本文详细解析了 Agent 如何理解人类语言,包括 Query 理解、改写与路由三个核心步骤。首先,Agent 通过意图识别、实体抽取和槽位填充来理解用户需求。接着,通过补全约束、拆子问题、假设性改写和退后一步等方法将口语翻译成机器可执行的指令。最后,通过规则路由、语义路由和 LLM 路由将任务分配给合适的工具。文章还提供了三条落地建议,帮助读者更好地应用 Agent 技术。建议收藏,方便后续参考。
Agent怎么听懂人话:Query理解、改写与路由
你随口一句「帮我安排下周出差」,一共七个字。但 Agent 要听懂这七个字,得先干三件事:听懂你要什么、把口语翻译成机器能执行的指令、把活派给对的工具。这三步,就是 Query 理解、改写与路由——Agent 规划能力的第一公里。上一篇聊了它怎么记住你,这篇聊它怎么听懂你。
一、Query 理解:先听懂,再动手
「帮我安排下周出差」这句话,人听着毫无障碍,机器听着全是窟窿:下周几走?去哪?预算多少?住什么标准?Agent 的第一步就是把这句话拆开,做三件事:
意图识别:你要的是「安排差旅行程」,不是「查天气」也不是「订外卖」。一句话对应一个或多个意图。
实体抽取:把关键信息抠出来——时间「下周」、动作「出差」。抠出来的实体就是后面调工具的参数。
槽位填充:目的地、出发地、预算、偏好……这些是「槽位」。填不上的槽位怎么办?靠谱的 Agent 会反问你,或者先去查——比如先调日历看看你下周哪几天有空。
这里就接上了上一篇的记忆系统:你上次说过「出差只坐高铁」「酒店不超过 600」,这些偏好存在长期记忆里,Query 理解阶段被检索出来,槽位就自动填上了。没有记忆的 Agent,每次都把你当新用户。
▲ 一句话进 Agent,要经过「听懂 → 说明白 → 派对人」三步加工
二、Query 改写:把口语翻译成「机器语言」
听懂之后,原话往往不能直接拿去检索或调工具——口语太随意了。改写就是做一次翻译,常见手法有四种:
① 补全约束:「下周出差」→「9 月 7 日至 9 月 11 日,北京到上海,预算 3000 元以内」。时间、地点、预算全部落到具体值。
② 拆子问题:一个大问题拆成「查日程冲突」「查机票」「查酒店」几个能独立执行的小问题——这是后面规划的基础。
③ 假设性改写(HyDE):2022 年底提出的经典方法——先让模型「假装」写出一段答案,再拿这段答案去检索相似内容,检索效果比直接用问题好不少(论文口径,在 TREC 检索基准上相对 BM25 有约 10% 的提升)。同期的 Query2doc、多查询扩展(同一个问题换几种说法一起搜)思路类似。
④ 退后一步(Step-Back):问题太具体时,先抽象一层——不问「周三下午飞上海的航班」,先问「本周去上海有哪几个时间窗」,拿到全局再钻细节。
这些手法看着花哨,本质就一句话:把「你想说的」变成「系统能用的」。
三、路由:把活派给对的人
改写完的指令要去执行,但 Agent 手上有日历、机票、酒店、邮件一堆工具,调哪个?这就是路由。工程上三种思路,成本和能力递增:
规则路由:关键词命中就走固定分支,「订」字一出现就派给订票工具。快、稳、零成本,但你换个说法它就不认识了。
语义路由:把问题变成向量,和每个工具的「能力描述」算相似度,谁像派给谁。「帮我搞定住的地方」也能对上酒店工具,不怕说法变,代价是要维护向量库、偶尔误判。
LLM 路由:让大模型自己读题、自己选工具,LangChain 的 RunnableBranch 就是这个模式。最灵活,能处理「顺便看看有没有便宜点的」这种复合意图,但又贵又慢,还偶尔会「想多了」。
▲ 三种路由方式:规则最快,LLM 最灵,工程上常混用
路由还有一个进阶形态:不只选工具,还选模型。2023 年的 HuggingGPT 就是这个思路——先规划任务,再给每个子任务挑选最合适的专家模型,最后整合结果。路由和 MCP 的关系也顺带说清:MCP 管的是工具「怎么接进来」,路由管的是接进来之后「这次用哪个」,一前一后,正好接上第③篇。
四、串一遍:一句话怎么变成一串动作
现在把「帮我安排下周出差」从头走一遍:
第 1 步 查日历:下周哪几天有空?发现周三到周五没会,行程窗口确定。
第 2 步 定行程:结合记忆里的偏好(高铁优先),确定出发到达时间。
第 3 步 并行干活:订机票和订酒店互不依赖,可以同时跑。2023 年底的 LLMCompiler 就是把任务画成一张有向无环图(DAG),能并行的并行,专门省等待时间。
第 4 步 汇总确认:生成行程单,请你确认之后才真的下单——花钱的节点留给人,这是第①篇说的人机协同决策点。
注意一个细节:订机票这种小任务,内部还在走第②篇的 ReAct 循环——想一步、查一下、看结果、再调整。规划管「先做什么后做什么」,ReAct 管「每一步怎么做」,两层套在一起才是完整的 Agent。这种「先定计划再执行、边执行边修正」的模式叫 Plan-and-Execute;ReWOO 更进一步,把推理和执行解耦,减少重复调用大模型的开销。
▲ 一句话拆成的任务树:有先后依赖,也有可并行的分支
五、给你的三条落地建议
① 用 Agent 时,主动把槽位给全:时间、地点、预算、偏好一次说清,能省掉它来回反问的三轮对话。
② 复杂任务先让它复述需求、列出计划再动手。计划不对可以改,直接做歪了返工更贵。
③ 自己搭 Agent 的话:路由规则写明确,给 LLM 兜底留出口,花钱的操作一律人工确认。能规则搞定的别上 LLM,便宜还稳定。
📌 收藏速查:Query 处理三件套
理解|意图识别 + 实体抽取 + 槽位填充,缺信息就反问或先查
改写|补全约束 / 拆子问题 / HyDE 假设改写 / Step-Back 退后一步
路由|规则 → 语义 → LLM,成本递增,能简单就别复杂
规划|Plan-and-Execute 定先后,LLMCompiler 找并行,ReAct 管每步执行
底线|花钱和不可逆的操作,永远留一个人工确认节点
建议收藏,下次用 Agent 安排复杂任务前翻出来对照。
最后
当下AI大模型是当下实打实的优质风口,岗位缺口大、发展前景广、薪资待遇突出,对比内卷严重、涨薪晋升困难的传统技术岗,是普通人转行逆袭的绝佳选择。
但很多想要入局大模型领域的朋友,都面临无系统学习路径、无实战资源、求职无方向的难题,一个人硬啃最容易走弯路、浪费大量时间精力。这里我结合多年一线实战与教学经验,整理出一套零基础大模型专属资料,包含:
- 系统化学习路线图(零基础到精通)
- 大模型学习书籍 & 文档(电子版)
- 2026 最新行业报告
- 项目实战 & 配套源码
- 大厂面试真题
需要的朋友,微信扫描下方 CSDN 官方认证二维码免费领取,保证 100% 免费。
👇👇扫码免费领取全部内容👇👇
下面简单介绍一下资料包含的内容:
1、大模型系统化学习路线图
专属定制从零基础入门到企业级实战的全阶段学习体系,划分清晰的四大学习阶段,规避碎片化学习弊端,适配新手
2、0基础到进阶视频教程
配套完整高清实操教程,覆盖Prompt提示工程、RAG知识库搭建、Agent智能体开发、模型微调、部署落地等核心知识点,所有课程搭配实操演示,零基础也能轻松看懂、上手实操。
3、大模型学习书籍 & 文档
汇总30+本行业经典AI、大模型、深度学习精选书籍,涵盖理论原理、开发实战、算法基础、AI产品思维等各类内容
4、AI大模型最新行业报告
整理2024-2026年最新大模型行业白皮书、市场分析报告,清晰展现行业发展趋势、技术迭代方向、岗位需求变化,帮助学习者精准把握行业风口,找准学习和就业方向
5、大厂面试真题
汇总了常见的AI大模型面试问题、知识点梳理和面经参考,方便求职时针对性准备。
6、大模型项目实战 & 配套源码
包含GPT应用开发、RAG私有知识库、智能问答系统等多个企业级实战项目,配套完整可运行源码,从简易Demo到完整商业应用全覆盖,帮助学习者将理论转化为落地实战能力,积累项目经验。
7、适合谁学?
- 传统后端 / Java / 前端开发,想转型 AI 应用
- 大学生、应届生,想拿更好的 offer
- 产品经理、运营,想武装职业竞争力
- 技术负责人,想给团队落地提效
学习是反人性的,但回报是真金白银。技术会更新,赛道会切换,但只要你先动手,机会就永远站在你这边。
8、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
想要入局AI大模型赛道、抢占行业红利的朋友,微信扫描下方CSDN官方认证二维码,即可100%免费领取全套学习资料!