☰
《AI Agent原理与实战》2026版 第3课 Agent 前世今生与经典范式
2026/10/9 2:47:19 网站建设 项目流程

本文收录于专栏agent智能体系列—— 专栏系统覆盖 AI Agent 的记忆、工具、插件与实战,点击订阅可跟踪后续更新。

本课定位:Agent和MLL的运行机制懂了,思想从哪来?本课把镜头拉远:介绍从符号主义 Agent、强化学习 Agent 到 LLM Agent 的三条谱系,再到 ReAct、Plan-and-Execute、Reflexion、ToT 四个经典范式。范式不是历史文物——第 6 课的循环里跑的就是 ReAct,第 22 课的编排是 Plan-and-Execute 的产品化。

阶段 1|概念与基础 | 来源:吸收微软课程微·03 Agentic Design Principles 与微·01 Agentic Patterns 的思想 | 知识更新至 2026-10

关键字:Agent发展史、ReAct范式、强化学习Agent、符号主义Agent、Plan-and-Execute、Reflexion、思维树ToT、LLM Agent起源

本节目录

  • 3.1 三条谱系:Agent 不是 2023 年才有的
  • 3.2 ReAct:Thought → Action → Observation
  • 3.3 Plan-and-Execute / Reflexion / Tree of Thoughts:三条改进路线
  • 3.4 从范式到产品:2023-2026 的时间线

概念讲解

3.1 三条谱系:Agent 不是 2023 年才有的

"Agent(智能体)"是 AI 的原生概念,比 LLM 老得多。理解谱系能帮你看清:今天的 LLM Agent 复兴,本质是旧的 Agent 框架换上了新的决策核心。

经典教科书定义(Russell & Norvig):Agent = 感知环境、做出决策、采取行动以达成目标的实体。这个定义贯穿三代——变的是"决策"怎么实现:符号推理 → 学习到的策略网络 → 大模型。

三代各自的遗产直接活在今天的 LLM Agent 里:

遗产来自在 LLM Agent 中的化身
任务分解与搜索符号主义(GPS 的手段-目的分析)Planner / Tree of Thoughts
感知-行动循环、奖励信号强化学习(MDP 框架)Agent loop、环境反馈、RL 微调(第 31 课)
记忆与反思认知架构(SOAR/ACT-R)短期/长期记忆、Reflexion

LLM Agent 的起飞点是 2022 年 10 月的 ReAct 论文(arXiv:2210.03629,Yao et al.)——它第一次把"推理"与"行动"交织成统一循环,其后几乎所有 Agent 系统都是它的变体或组合。

3.2 ReAct:Thought → Action → Observation

ReAct(Reason + Act)的循环结构:

Question: 哪个国家的人口是日本的 1.5 倍以上且国土相邻? Thought 1: 我需要先查日本人口。 Action 1: search[日本 人口] Observation 1: 日本人口约 1.24 亿(2023 年)。 Thought 2: 1.5 倍约 1.86 亿。候选邻国里俄罗斯远超…… Action 2: search[俄罗斯 人口] Observation 2: 俄罗斯人口约 1.44 亿…… Thought 3: 不够 1.86 亿。中国人口约 14 亿,满足。 Action 3: finish[中国]

三个成分的分工:

  • Thought(思考):模型显式写出推理——决定下一步查什么、评估已有信息。这是 chain-of-thought 的行动版。
  • Action(行动):调用外部环境(论文里是 Wikipedia API)。
  • Observation(观察):环境返回结果,进入下一轮 Thought。

ReAct 论文的核心贡献是证明双向增强:推理引导行动(reason to act——知道该查什么),行动反哺推理(act to reason——查回来的事实修正推理)。在 HotpotQA/Fever 上,ReAct 通过与 Wikipedia API 交互,缓解了纯 chain-of-thought 的幻觉与错误传播;在 ALFWorld/WebShop 两个交互环境上,ReAct 分别比模仿学习和强化学习基线高出 34% / 10% 的绝对成功率(仅用 1-2 个示例做 few-shot)。

今天你去用任何主流 Agent(Claude Code、OpenAI 深度研究、各家编码 Agent),其骨架仍是 ReAct——只是 Thought 藏进了模型的 reasoning 部分,Action 变成了标准 tool_calls 协议(第 2 课)。

3.3 Plan-and-Execute / Reflexion / Tree of Thoughts:三条改进路线

ReAct 是逐步反应式的:每一步只看局部。它的三个已知弱点及对应改进范式:

弱点 1:长任务漂移——走一步看一步,目标容易丢。→Plan-and-Execute(先规划后执行)

Plan: ① 查 X ② 查 Y ③ 对比 ④ 写结论 Execute: 逐步执行计划,必要时 Replan

规划与执行分离的思想来自 Plan-and-Solve prompting(Wang et al., ACL 2023, arXiv:2305.04091),LangChain 将其工程化为 Plan-and-Execute agent:Planner(大模型,一次性出完整计划)+ Executor(小模型,逐步执行)+ Replanner(失败时重规划)。优点:大模型调用次数少、长任务不漂移、大小模型分工省钱;代价:计划可能过时,需要 replan 机制兜底。

弱点 2:失败不复盘——错了就错了,下次还错。→Reflexion(语言化反思)

Trial 1: 尝试 → 失败(测试不过) Reflect : "失败因为没处理空输入,下次要先做边界检查" Trial 2: 带着反思文本重试 → 通过

Reflexion(Shinn et al., NeurIPS 2023, arXiv:2303.11366)提出"verbal reinforcement learning":不更新权重,把失败教训写成文字存入 episodic memory,作为下一轮的上下文。名场面:HumanEval 编程基准上 Reflexion 达到 91% pass@1,超过当时 GPT-4 直接生成的 80%。这是"Agent 自我改进"最简单可行的形态(第 12 课深入其局限)。

弱点 3:单链探索——一条路走到黑,不能回头。→Tree of Thoughts(思维树)

ToT(Yao et al., NeurIPS 2023, arXiv:2305.10601)把推理组织成树:每步生成多个候选"thought",用模型自评做启发式剪枝,配 BFS/DFS 搜索,支持回溯。Game of 24 任务上 GPT-4 + CoT 成功率 4%,ToT 达 74%。代价是调用次数暴涨(每个节点都是一次推理),生产 Agent 中多用于离线难题求解而非在线循环。

一图总览四范式:

范式决策时机核心机制强项弱项
ReAct每步Thought-Action-Observation 交替通用、实时纠偏长任务漂移、贵
Plan-and-Execute开局先出全计划再执行省大模型、目标稳计划过时需 replan
Reflexion失败后文字反思入记忆重试自我改进需要明确失败信号
ToT每步多分支生成-评估-搜索-回溯难题探索调用量爆炸

3.4 从范式到产品:2023-2026 的时间线

  • 2023 上半年:AutoGPT/BabyAGI 引爆"自主 Agent"想象——但完成率惨淡,暴露了规划与记忆的短板。
  • 2023-2024:范式沉淀期。LangChain/LlamaIndex 把 ReAct/Plan-Execute 工具化;OpenAI function calling 让 Action 标准化。
  • 2024-2025:Anthropic《Building Effective Agents》(2024-12-19)给行业泼冷水又指路:多数场景 workflow 足够,Agent 用在刀刃上;MCP 协议(Anthropic 2024-11-25 开源发布)统一工具接入。
  • 2025-2026:编码 Agent(Claude Code、Devin 类)与深度研究 Agent 成为两类最先规模落地的形态;多 Agent 编排、Agentic RL 成为前沿(第 31 课)。

案例实战:同一任务,ReAct 与 Plan-and-Execute 的行为对比

目标:用一个真实信息检索任务,观察两种范式的行为差异,理解各自适用面。

任务:“查证:珠穆朗玛峰的高度乘以 3.28084 后,是否大于 25000 英尺?”

步骤一:ReAct 风格轨迹(基于第 6 课将实现的 mini agent,工具=search + calculator,此处展示轨迹形态)

Thought 1: 需要先获取珠峰准确高度。 Action 1: search(query="珠穆朗玛峰 高度") Observation 1: 珠穆朗玛峰海拔约 8848.86 米(2020 年测定)。 Thought 2: 现在计算 8848.86 × 3.28084。 Action 2: calculator(expr="8848.86*3.28084") Observation 2: 29031.6938424 Thought 3: 29031.69 > 25000,结论成立。信息充分,可以回答。 Action 3: finish(是,约 29032 英尺 > 25000 英尺)

步骤二:Plan-and-Execute 风格轨迹

Plan: 1. 检索珠峰高度(米) 2. 计算高度 × 3.28084(英尺) 3. 与 25000 比较并给结论 Execute step 1: search → 8848.86 米 Execute step 2: calculator → 29031.69 Execute step 3: 29031.69 > 25000 → 是 (全程无 Replan)

步骤三:对比分析——两种范式在本任务上结果一致,差异在过程属性:

观察ReActPlan-and-Execute
大模型调用3 次决策(每次都带完整思考)1 次规划 + 3 次轻执行
中途改向能力强(Thought 2 可临时换查法)弱(除非触发 replan)
可审计性轨迹即推理过程计划先行,合规友好
若 step 2 工具报错下一轮 Thought 立即处理需要显式 replan 分支

结论:两步就能完成的任务两者无差别;任务一长(10+ 步)、或需要并行执行子任务,Plan-and-Execute 的成本与稳定性优势才显现;环境高度不确定、每步都可能改变策略的场景,ReAct 的反应性更值钱。这也是第 22 课 orchestrator-workers(先拆分再并行)的选型逻辑。

完整代码:本课轨迹为示意(基于第 6 课已实测的 mini_agent.py 运行形态整理,2026-10-01 实测输出节选:调用 search({'query': '珠穆朗玛峰高度'})→调用 calculator({'expr': '8848.86*3.28084'})→ 最终回答 29031.69 英尺)。第 6 课提供可运行完整实现;Plan-and-Execute 的编排思想在第 9 课的 orchestrator-workers 模式中展开。

小结

  • Agent 概念三代同堂:符号主义给了分解与搜索,强化学习给了循环与奖励,LLM 给了通用语言决策核心。
  • ReAct(2022-10)是 LLM Agent 的起点范式:Thought-Action-Observation 交织,推理与行动互哺。
  • 三大改进路线对症 ReAct 三弱点:Plan-and-Execute 治漂移、Reflexion 治不复盘、ToT 治单链不回头。
  • 范式选择是成本/稳定性/反应性的三角权衡,没有万能解;产品化主线是"workflow 优先,Agent 点睛"。
  • 本课的四范式将在第 5 课被装进"四大件"组件框架重新标注,在第 9 课扩展为完整模式体系。

扩展阅读

🌐 网络提示:学术站 arxiv.org 境内多可直连(慢),其余评测/规范站需代理。详见总纲附录《国内网络访问与国产适配指南》。

  • ReAct 原论文:Yao et al., arXiv:2210.03629(ICLR 2023)https://arxiv.org/abs/2210.03629
  • Reflexion:Shinn et al., arXiv:2303.11366(NeurIPS 2023)https://arxiv.org/abs/2303.11366
  • Tree of Thoughts:Yao et al., arXiv:2305.10601(NeurIPS 2023)https://arxiv.org/abs/2305.10601
  • Plan-and-Solve:Wang et al., arXiv:2305.04091(ACL 2023)https://arxiv.org/abs/2305.04091
  • LLM Agent 综述(329 篇文献):arXiv:2503.21460 https://arxiv.org/abs/2503.21460

我的专栏

蛋白 / 抗体 / 多肽 / 核酸分子模拟 / 动力学 / 对接药物 / 设计 / 案例AI / Agent / 大模型
开源蛋白结构预测分子模拟基础小分子药物设计案例AI Agent系列
开源蛋白生成方法实践分子动力学模拟-Amber蛋白药物设计案例化学大模型
开源多肽设计模型分子动力学模拟-Gromacs多肽药物设计案例《AI Agent原理与实战》
开源多肽性质预测分子动力学模拟-OpenMM开源小分子生成设计CADD中的机器学习模型
DNA/RNA药物设计結合自由能高效计算配置《MCP 入门实战》
siRNA药物设计模型UCSF DOCK系列我胡师兄说药《AI入门实战2026》
ASO药物设计模型rDock系列 LeDock系列 gnina系列《经典机器学习实战》

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询