本文收录于专栏agent智能体系列—— 专栏系统覆盖 AI Agent 的记忆、工具、插件与实战,点击订阅可跟踪后续更新。
本课定位:Agent和MLL的运行机制懂了,思想从哪来?本课把镜头拉远:介绍从符号主义 Agent、强化学习 Agent 到 LLM Agent 的三条谱系,再到 ReAct、Plan-and-Execute、Reflexion、ToT 四个经典范式。范式不是历史文物——第 6 课的循环里跑的就是 ReAct,第 22 课的编排是 Plan-and-Execute 的产品化。
阶段 1|概念与基础 | 来源:吸收微软课程微·03 Agentic Design Principles 与微·01 Agentic Patterns 的思想 | 知识更新至 2026-10
关键字:Agent发展史、ReAct范式、强化学习Agent、符号主义Agent、Plan-and-Execute、Reflexion、思维树ToT、LLM Agent起源
本节目录
- 3.1 三条谱系:Agent 不是 2023 年才有的
- 3.2 ReAct:Thought → Action → Observation
- 3.3 Plan-and-Execute / Reflexion / Tree of Thoughts:三条改进路线
- 3.4 从范式到产品:2023-2026 的时间线
概念讲解
3.1 三条谱系:Agent 不是 2023 年才有的
"Agent(智能体)"是 AI 的原生概念,比 LLM 老得多。理解谱系能帮你看清:今天的 LLM Agent 复兴,本质是旧的 Agent 框架换上了新的决策核心。
经典教科书定义(Russell & Norvig):Agent = 感知环境、做出决策、采取行动以达成目标的实体。这个定义贯穿三代——变的是"决策"怎么实现:符号推理 → 学习到的策略网络 → 大模型。
三代各自的遗产直接活在今天的 LLM Agent 里:
| 遗产 | 来自 | 在 LLM Agent 中的化身 |
|---|---|---|
| 任务分解与搜索 | 符号主义(GPS 的手段-目的分析) | Planner / Tree of Thoughts |
| 感知-行动循环、奖励信号 | 强化学习(MDP 框架) | Agent loop、环境反馈、RL 微调(第 31 课) |
| 记忆与反思 | 认知架构(SOAR/ACT-R) | 短期/长期记忆、Reflexion |
LLM Agent 的起飞点是 2022 年 10 月的 ReAct 论文(arXiv:2210.03629,Yao et al.)——它第一次把"推理"与"行动"交织成统一循环,其后几乎所有 Agent 系统都是它的变体或组合。
3.2 ReAct:Thought → Action → Observation
ReAct(Reason + Act)的循环结构:
Question: 哪个国家的人口是日本的 1.5 倍以上且国土相邻? Thought 1: 我需要先查日本人口。 Action 1: search[日本 人口] Observation 1: 日本人口约 1.24 亿(2023 年)。 Thought 2: 1.5 倍约 1.86 亿。候选邻国里俄罗斯远超…… Action 2: search[俄罗斯 人口] Observation 2: 俄罗斯人口约 1.44 亿…… Thought 3: 不够 1.86 亿。中国人口约 14 亿,满足。 Action 3: finish[中国]三个成分的分工:
- Thought(思考):模型显式写出推理——决定下一步查什么、评估已有信息。这是 chain-of-thought 的行动版。
- Action(行动):调用外部环境(论文里是 Wikipedia API)。
- Observation(观察):环境返回结果,进入下一轮 Thought。
ReAct 论文的核心贡献是证明双向增强:推理引导行动(reason to act——知道该查什么),行动反哺推理(act to reason——查回来的事实修正推理)。在 HotpotQA/Fever 上,ReAct 通过与 Wikipedia API 交互,缓解了纯 chain-of-thought 的幻觉与错误传播;在 ALFWorld/WebShop 两个交互环境上,ReAct 分别比模仿学习和强化学习基线高出 34% / 10% 的绝对成功率(仅用 1-2 个示例做 few-shot)。
今天你去用任何主流 Agent(Claude Code、OpenAI 深度研究、各家编码 Agent),其骨架仍是 ReAct——只是 Thought 藏进了模型的 reasoning 部分,Action 变成了标准 tool_calls 协议(第 2 课)。
3.3 Plan-and-Execute / Reflexion / Tree of Thoughts:三条改进路线
ReAct 是逐步反应式的:每一步只看局部。它的三个已知弱点及对应改进范式:
弱点 1:长任务漂移——走一步看一步,目标容易丢。→Plan-and-Execute(先规划后执行)
Plan: ① 查 X ② 查 Y ③ 对比 ④ 写结论 Execute: 逐步执行计划,必要时 Replan规划与执行分离的思想来自 Plan-and-Solve prompting(Wang et al., ACL 2023, arXiv:2305.04091),LangChain 将其工程化为 Plan-and-Execute agent:Planner(大模型,一次性出完整计划)+ Executor(小模型,逐步执行)+ Replanner(失败时重规划)。优点:大模型调用次数少、长任务不漂移、大小模型分工省钱;代价:计划可能过时,需要 replan 机制兜底。
弱点 2:失败不复盘——错了就错了,下次还错。→Reflexion(语言化反思)
Trial 1: 尝试 → 失败(测试不过) Reflect : "失败因为没处理空输入,下次要先做边界检查" Trial 2: 带着反思文本重试 → 通过Reflexion(Shinn et al., NeurIPS 2023, arXiv:2303.11366)提出"verbal reinforcement learning":不更新权重,把失败教训写成文字存入 episodic memory,作为下一轮的上下文。名场面:HumanEval 编程基准上 Reflexion 达到 91% pass@1,超过当时 GPT-4 直接生成的 80%。这是"Agent 自我改进"最简单可行的形态(第 12 课深入其局限)。
弱点 3:单链探索——一条路走到黑,不能回头。→Tree of Thoughts(思维树)
ToT(Yao et al., NeurIPS 2023, arXiv:2305.10601)把推理组织成树:每步生成多个候选"thought",用模型自评做启发式剪枝,配 BFS/DFS 搜索,支持回溯。Game of 24 任务上 GPT-4 + CoT 成功率 4%,ToT 达 74%。代价是调用次数暴涨(每个节点都是一次推理),生产 Agent 中多用于离线难题求解而非在线循环。
一图总览四范式:
| 范式 | 决策时机 | 核心机制 | 强项 | 弱项 |
|---|---|---|---|---|
| ReAct | 每步 | Thought-Action-Observation 交替 | 通用、实时纠偏 | 长任务漂移、贵 |
| Plan-and-Execute | 开局 | 先出全计划再执行 | 省大模型、目标稳 | 计划过时需 replan |
| Reflexion | 失败后 | 文字反思入记忆重试 | 自我改进 | 需要明确失败信号 |
| ToT | 每步多分支 | 生成-评估-搜索-回溯 | 难题探索 | 调用量爆炸 |
3.4 从范式到产品:2023-2026 的时间线
- 2023 上半年:AutoGPT/BabyAGI 引爆"自主 Agent"想象——但完成率惨淡,暴露了规划与记忆的短板。
- 2023-2024:范式沉淀期。LangChain/LlamaIndex 把 ReAct/Plan-Execute 工具化;OpenAI function calling 让 Action 标准化。
- 2024-2025:Anthropic《Building Effective Agents》(2024-12-19)给行业泼冷水又指路:多数场景 workflow 足够,Agent 用在刀刃上;MCP 协议(Anthropic 2024-11-25 开源发布)统一工具接入。
- 2025-2026:编码 Agent(Claude Code、Devin 类)与深度研究 Agent 成为两类最先规模落地的形态;多 Agent 编排、Agentic RL 成为前沿(第 31 课)。
案例实战:同一任务,ReAct 与 Plan-and-Execute 的行为对比
目标:用一个真实信息检索任务,观察两种范式的行为差异,理解各自适用面。
任务:“查证:珠穆朗玛峰的高度乘以 3.28084 后,是否大于 25000 英尺?”
步骤一:ReAct 风格轨迹(基于第 6 课将实现的 mini agent,工具=search + calculator,此处展示轨迹形态)
Thought 1: 需要先获取珠峰准确高度。 Action 1: search(query="珠穆朗玛峰 高度") Observation 1: 珠穆朗玛峰海拔约 8848.86 米(2020 年测定)。 Thought 2: 现在计算 8848.86 × 3.28084。 Action 2: calculator(expr="8848.86*3.28084") Observation 2: 29031.6938424 Thought 3: 29031.69 > 25000,结论成立。信息充分,可以回答。 Action 3: finish(是,约 29032 英尺 > 25000 英尺)步骤二:Plan-and-Execute 风格轨迹
Plan: 1. 检索珠峰高度(米) 2. 计算高度 × 3.28084(英尺) 3. 与 25000 比较并给结论 Execute step 1: search → 8848.86 米 Execute step 2: calculator → 29031.69 Execute step 3: 29031.69 > 25000 → 是 (全程无 Replan)步骤三:对比分析——两种范式在本任务上结果一致,差异在过程属性:
| 观察 | ReAct | Plan-and-Execute |
|---|---|---|
| 大模型调用 | 3 次决策(每次都带完整思考) | 1 次规划 + 3 次轻执行 |
| 中途改向能力 | 强(Thought 2 可临时换查法) | 弱(除非触发 replan) |
| 可审计性 | 轨迹即推理过程 | 计划先行,合规友好 |
| 若 step 2 工具报错 | 下一轮 Thought 立即处理 | 需要显式 replan 分支 |
结论:两步就能完成的任务两者无差别;任务一长(10+ 步)、或需要并行执行子任务,Plan-and-Execute 的成本与稳定性优势才显现;环境高度不确定、每步都可能改变策略的场景,ReAct 的反应性更值钱。这也是第 22 课 orchestrator-workers(先拆分再并行)的选型逻辑。
完整代码:本课轨迹为示意(基于第 6 课已实测的 mini_agent.py 运行形态整理,2026-10-01 实测输出节选:调用 search({'query': '珠穆朗玛峰高度'})→调用 calculator({'expr': '8848.86*3.28084'})→ 最终回答 29031.69 英尺)。第 6 课提供可运行完整实现;Plan-and-Execute 的编排思想在第 9 课的 orchestrator-workers 模式中展开。
小结
- Agent 概念三代同堂:符号主义给了分解与搜索,强化学习给了循环与奖励,LLM 给了通用语言决策核心。
- ReAct(2022-10)是 LLM Agent 的起点范式:Thought-Action-Observation 交织,推理与行动互哺。
- 三大改进路线对症 ReAct 三弱点:Plan-and-Execute 治漂移、Reflexion 治不复盘、ToT 治单链不回头。
- 范式选择是成本/稳定性/反应性的三角权衡,没有万能解;产品化主线是"workflow 优先,Agent 点睛"。
- 本课的四范式将在第 5 课被装进"四大件"组件框架重新标注,在第 9 课扩展为完整模式体系。
扩展阅读
🌐 网络提示:学术站 arxiv.org 境内多可直连(慢),其余评测/规范站需代理。详见总纲附录《国内网络访问与国产适配指南》。
- ReAct 原论文:Yao et al., arXiv:2210.03629(ICLR 2023)https://arxiv.org/abs/2210.03629
- Reflexion:Shinn et al., arXiv:2303.11366(NeurIPS 2023)https://arxiv.org/abs/2303.11366
- Tree of Thoughts:Yao et al., arXiv:2305.10601(NeurIPS 2023)https://arxiv.org/abs/2305.10601
- Plan-and-Solve:Wang et al., arXiv:2305.04091(ACL 2023)https://arxiv.org/abs/2305.04091
- LLM Agent 综述(329 篇文献):arXiv:2503.21460 https://arxiv.org/abs/2503.21460
我的专栏
| 蛋白 / 抗体 / 多肽 / 核酸 | 分子模拟 / 动力学 / 对接 | 药物 / 设计 / 案例 | AI / Agent / 大模型 |
|---|---|---|---|
| 开源蛋白结构预测 | 分子模拟基础 | 小分子药物设计案例 | AI Agent系列 |
| 开源蛋白生成方法实践 | 分子动力学模拟-Amber | 蛋白药物设计案例 | 化学大模型 |
| 开源多肽设计模型 | 分子动力学模拟-Gromacs | 多肽药物设计案例 | 《AI Agent原理与实战》 |
| 开源多肽性质预测 | 分子动力学模拟-OpenMM | 开源小分子生成设计 | CADD中的机器学习模型 |
| DNA/RNA药物设计 | 結合自由能 | 高效计算配置 | 《MCP 入门实战》 |
| siRNA药物设计模型 | UCSF DOCK系列 | 我胡师兄说药 | 《AI入门实战2026》 |
| ASO药物设计模型 | rDock系列 LeDock系列 gnina系列 | 《经典机器学习实战》 |