小白程序员必看:收藏这份AI Agent学习指南,轻松掌握大模型核心技术!
2026/9/15 8:17:15 网站建设 项目流程

本文深入解析AI Agent的核心工作机制,将其定义为调用工具的循环系统,包含Loop循环、Tools、Memory和Harness四大核心构成。通过ReAct模式,Agent模拟人类工作流程,实现自主规划与执行。Tools赋予Agent行动能力,Memory作为知识库存储上下文信息,Harness则负责系统底层架构与调度。理解这四大模块,有助于提升工作效率,开发智能工具产品。

Agent到底是什么?

你可能已经有个大概的了解:是会帮人们干活的大模型。

你也可能已经听到一些像(能自主规划执行的)Workflow、数字员工这样的名词概念。

以上这些说法虽然不能说错,但还不够。

我们希望知道,Agent到底是怎么工作的?有哪些构成?

如果要更好使用Agent,能帮助我们提升工作效率、开发工具产品,就需要进一步深入了解Agent底层的工作机制和核心模块。

这篇文章,尝试回答这些问题。

首先,我们给Agent下一个更为具体简练的定义。

AI Agent是一个能够调用工具的循环系统。

这个定义抓住了Agent两个更为本质的特征,反映Agent在工作时真正发生了什么:

1、Agent的核心工作机制:Loop循环。(ReAct模式,下面展开)

2、Agent的行动能力:对Tools工具的调用。

同时,Agent系统在调用Tools执行Loop循环过程中,强依赖两个条件:

1、Agent将Context(需要让LLM读取的上下文信息)输入到LLM,而每次的执行结果需要被保留并作为Context输入到后续的执行中(否则每次循环执行都是全新的过程,也就谈不上智能了)。

2、整个循环过程、对工具的调用,需要有一个指挥官统一协调管理来处理各种问题情况。

因而就有了另外两个模块:MemoryHarness

总的来说,Agent由这四个核心构成:Loop、Tools、Memory、Harness。

下面分别拆解。

1、Loop:Agent的工作机制

你输入一段文本,LLM收到后给你回答一段文本:这是LLM做的事情,具体应用形态是大家已经熟悉的Chatbot(聊天机器人)。

Agent跟LLM的主要区别在于:

你输入文本给到LLM,LLM输出的也是文本。

而同样的事情,Agent输出的是一次具体的行动(执行Tool);这次行动执行的结果要继续输入给LLM,LLM据此判断下一步要做什么(Loop循环)。

Agent在工作时,实际上底层机制就是在执行Loop循环。

这个Loop循环,遵循ReAct模式,包括以下步骤:

  1. Reason(思考推理):LLM调研规划,先调研规划,明确要做什么、怎么做;2.Act(行动):模型调用Tools开始干活;3.Observe(观察/评估):观察阶段结果是否已经满足预期;4.再到下一轮的Reason…如是往复:前面的行动结果作为输入给到LLM,开始下一轮的循环,直到Agent判断认为已经得出目标答案。

你会发现,这个基于ReAct的Loop循环,其实是对人类实际工作过程的模拟抽象,很类似于PDCA戴明环。

所有Agent(不管是coding、研究、做PPT、客服…)可能表面上看似不同(流程、工具、需要的上下文),但工作时底层机制是一样的,都是这个Loop循环。

由此也可以发现,LLM本身仍然是在思考、推理并生成文本,只是Agent里的LLM生成的文本可以是“运行某个Tool”这样的执行指令。

Agent系统有能力去调取这个Tool并按照指令执行,从而完成了一次行动并交付交付。

那么Tool在这里又是什么呢?

2、Tools:Agent的手脚(执行能力)

Tool就是可供LLM调用的一项具体能力,比如:

打开浏览器;搜索网页;发送邮件;查询数据库;翻译一段文字;操控电脑;检查代码;查询日历;……

就像给大脑提供了手脚,有了手脚,也就有了行动能力。

为了让LLM知道这个能力是干什么的,Tools需要有较为明确的名称和描述说明(description)。

可以想象一个操作系统界面,上面布满了按钮,每点一个按钮就会执行一个特定的动作。LLM跟你一样,需要给他输入这些按钮的名称和功能说明,才能判断什么时候该按哪个按钮(即什么时候该用哪些Tools)。

所以关于Tools使用的一个最佳实践,就是在设计时尽量明确一个tool就对应一项简单具体的任务,简单到description里一两句话就能描述清楚是做什么的。

这样LLM的判断会更准确,Agent的执行效果就会越好。

作为Agent系统的核心组成部分,一些常用的公共的Tools,很多系统已经预置了。

你也可以在需要时接入外部的Tools,从而扩展系统的能力。

此时就需要用到MCP。这是连接Agent系统和外部系统的一种开放标准协议,进一步了解可以参考之前的文章,添加所需要外部工具提供方的MCP服务器即可实现调用。

除了Agent系统预置和外部服务,你也可以自己制作Tools,从而满足比较个性化的需求。

再强调一遍,Tool是能力,不是知识(来自于下面要讲的Memory)。做一件事情,离不开知识和能力,知识(knowledge)作为Context并被保存在Memory里供Agent读取参考,而能力(Tools)让Agent可以行动,对现实物理世界做出改变。

所以要分清楚:Tool负责“能做什么、做了什么”,并不承担“怎么做”。

后者属于我们下面要讲的Memory即知识库的范畴。

3、Memory:知识库

为什么需要有Memory?

Agent的核心机制Loop是在上一次循环结束后要将执行结果和历史所有资料作为Context输入给下一次循环。

要做到这一点,就必须要有一个地方把每次的Context存下来能被读取到。

这就是Memory做的事情,听上去很像计算机里的缓存(RAM)。

那么Memory具体是怎么实现的呢?

之前采用的技术方案主要是向量数据库(vector databases),简单来说,就是将Context的所有文件信息做embedding(转换为向量特征),每次运行时找到特征值最相似(similarity)的数据块(chunks),从而判断哪些数据更应该被读取作为输入。

如今的技术方案,更多采用的是知识库,即许多markdown文件的文件夹集合。

Agent通过搜索关键词,读取每个文件的标题、描述信息,以及文件夹的树状结构,会更加容易和准确判断出哪些内容对于下一次循环以及整个任务目标更相关。这个过程,很像是一个新员工开始工作时要读取公司或部门的Wiki文档(或者老员工留下来的交接文案文档)。

如果你有使用过Agent,可能会注意到在推理和执行过程中,会出现“搜索××关键词→找到n份文档→读取文档内容→已了解背景信息”这样的提示,就是Agent在使用Memory知识库。

这里的关键在于文件本身和文件夹的结构化,相比于原有的向量数据库的相似度更有优势。

更妙的是,知识库里的文件除了可被读取,还能改写。这意味着Context里的内容可以随时更新迭代,比如上一个任务的执行结果日志、报错记录,比如新增了一个数据资料文档等等。

所以,当前Memory的工作方式实质上就是每次执行过程中对Context里文件读取和增删改写。

这也是为什么我们会感知到Agent越来越懂自己,能单次多轮对话、读取历史对话,能根据最新情况做调整。

而作为告诉Agent怎么做的操作手册,Skill使用markdown文件夹(可随时迭代修改)的交互范式被越来越多的大模型厂商接受。

4、Harness:底层基础设施

Agent作为一个系统并不是魔法,本身需要对执行中的各种基础细节问题做处理解决,就我们前面讲到的3个核心组件来说:

谁来发起并控制Loop循环?谁执行Tools?谁管理Context,尤其是Context可能过长的时候?

此外,还有:

执行出错了如何处理?调用工具的权限管控?(你也不希望Agent随时能控制你电脑上的任何软硬件和文件吧)什么时候该让用户提供更多信息,确认是否往下进行?

一个稳定的优秀的Agent系统,就要对上面这些问题处理得更好,用户的使用体验也就更好。

这也就是Agent的第四个核心组件(而且当前似乎已成为最重要):Harness要做的事情。

Harness好像还没有一个共识的翻译,一般可以叫做框架、编排、运行环境… 可将其看做是Agent的底层架构、基础设施、操作系统。

像Codex、Claude Code、Workbuddy、TraeWork/TraeCode、Deepseek Harness这类Agent产品,从工程角度看,主要构成就是Harness,就像Windows、MacOS、Linux操作系统那样。

在这些有着更友好易用界面的Agent产品出现之前,要搭建一个Agent,里面的功能组件大概要靠用户自己用Python手搓出来,要写一大堆的条件循环函数来实现:Loop及其调度、任务何时应中止或重试、在Context不同文件之间注意力的跳转…

如今这些繁琐的编排调度工作,都被Harness包含并接管了。

把上面这4个组件合在一起,就能看到一个AI Agent到底是什么:

Loop机制:调用模型、工具,执行、重复,直到任务完成;Tools执行:让大模型具有行动能力,包括对读取文件、使用Shell程序,以及连接MCP服务器;Memory知识库:实现循环过程中对Context上下文管理,判断并决定哪些内容应该放在context window中(尤其是对话交互越来越长的情况下)。Harness:整个系统的基础设施,运行出问题如何解决,权限验证登(哪些操作Agent可以自行把控,而哪些需要请求人类用户允许。太过频繁你会觉得事儿多,一路干到底不问你你也会心虚。可将管理中授权是个艺术,可见老板也不好当)。

在广义的产品意义上,Harness基本等同于我们在用的Agent,因为Harness把前面说的机制和组件都纳入到架构中,并成为Agent的运行环境和基础设施。

乃至最终我们可以这样简要总结:

Agent = LLM + Harness。

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包

  • ✅ 从零到一的 AI 学习路径图
  • ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
  • ✅ 百度/阿里专家闭门录播课
  • ✅ 大模型当下最新行业报告
  • ✅ 真实大厂面试真题
  • ✅ 2026 最新岗位需求图谱

所有资料 ⚡️ ,朋友们如果有需要《AI大模型入门+进阶学习资源包》下方扫码获取~

① 全套AI大模型应用开发视频教程

(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)

② 大模型系统化学习路线

作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!

③ 大模型学习书籍&文档

学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。

④ AI大模型最新行业报告

2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

⑤ 大模型项目实战&配套源码

学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。

⑥ 大模型大厂面试真题

面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余

以上资料如何领取?

为什么大家都在学大模型?

最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!

不出1年,“有AI项目经验”将成为投递简历的门槛。

风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!

这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

以上全套大模型资料如何领取?

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询