"接入大模型"在很多项目里是一笔糊涂账——业务方觉得接入了就能自动聊客户、自动跟单、自动成交,技术方知道大模型会幻觉、会算错数,但说不清到底哪些场景靠谱。把大模型能力拆成五层——对话理解、信息抽取、逻辑推理、任务规划、动作执行——每层的成熟度、出错代价和落地方式完全不同。这张能力地图能帮团队回答"这个需求该不该交给大模型"。
一、第一层对话理解与生成——最成熟放心用
对话理解是大模型最成熟的能力:理解客户自然语言问题、生成通顺得体的回复、做意图归类和情绪判断。这一层的特点是"出错代价低"——回复不够好客户顶多觉得答非所问,不会造成业务损失,可以放心自动执行。
微信场景里这层覆盖大量日常需求:智能客服问答、多轮闲聊承接、消息摘要(把长对话浓缩成几句)、客户情绪识别(愤怒/着急/满意)、回复话术润色。落地方式是"知识库约束生成"——模型不凭空回答,基于检索到的企业知识内容组织回复,幻觉空间被大幅压缩。这一层的工程重点不在模型本身,在知识库质量和提示词工程。
二、第二层信息抽取——结构清晰可校验
信息抽取把非结构化对话变成结构化数据:从"我那个上周买的蓝色的杯子还没到"中抽取出实体——时间(上周)、商品属性(蓝色、杯子)、诉求(查物流)。抽取的好处是结构化结果可以直接驱动业务流程(查物流需要订单信息)。
这一层比对话理解多了一点风险——抽错实体可能走错流程。但抽取结果天然可校验:订单号必须符合格式、商品名必须在商品库里匹配上、时间必须能解析成日期。校验失败就让机器人追问补全,不带着错误数据往下走。配合规则和词典能达到很高准确率,是性价比极高的一层。
三、第三层逻辑推理——可用但必须有校验闭环
推理层处理需要"想一想"的问题:根据订单状态推断现在能不能改地址(已发货就不行)、根据退换货政策推断客户情况是否符合条件、根据多个条件判断走什么售后分支。这类问题规则引擎也能做,但规则多了维护成本高,大模型能直接读懂政策文档并应用到具体案例。
推理层的出错代价明显升高——判断错政策可能造成经济损失或投诉。落地原则是"模型推理+规则复核":模型给出推理结论和依据,关键场景再用确定性规则二次校验,两者一致才执行,不一致转人工。涉及金额、权益、承诺的推理结论不允许模型直接输出给客户,必须经过规则或人工这道关。
四、第四层任务规划与第五层动作执行——越靠后越要管控
任务规划把复杂目标拆成步骤(前面讲的工作流编排),动作执行是真正调用接口改变现实状态——发消息、改订单、退款。这两层的出错代价最高:规划错了浪费执行资源,执行错了直接影响真实客户和真金白银。
这两层的成熟度不是问题(模型能拆步骤也能生成工具调用),管控才是核心:执行动作分级(只读自动、写入确认、高危禁止)、规划结果做安全审查、全流程留痕可回放。这两层的价值也最大——前三层帮人"看和想",后两层帮人"做",但自动化程度必须与团队的管控能力匹配,宁可慢开放也不能裸奔。
五层能力对照
能力层 | 典型场景 | 成熟度 | 出错代价 | 落地策略 |
|---|---|---|---|---|
对话理解 | 客服问答/摘要/情绪 | 高 | 低 | 知识库约束,放心用 |
信息抽取 | 实体/诉求结构化 | 高 | 低 | 格式+库表校验 |
逻辑推理 | 政策适用/条件判断 | 中 | 中 | 模型结论+规则复核 |
任务规划 | 复杂目标拆步骤 | 中 | 中高 | 计划安全审查 |
动作执行 | 发消息/改单/退款 | 中 | 高 | 分级授权+全留痕 |
五层能力的协同调用
class CapabilityRouter: def handle(self, wxid, text, context): # L1 理解:意图+情绪 intent = llm_classify(text) sentiment = llm_sentiment(text) # L2 抽取:结构化实体,带校验 slots = llm_extract(text, schema=ORDER_SCHEMA) slots = self.validate_slots(slots) # 格式/库表校验 if slots.missing: return ask_for(slots.missing[0]) if intent == "policy_question": # L3 推理:政策适用,规则复核 conclusion = llm_reason( policy_docs=kb.search("退换货政策"), case=slots) if not self.rule_recheck(conclusion, slots): return handoff_human(wxid, reason="推理与规则不一致") return conclusion if intent == "complex_task": # L4+L5 规划+执行:进管控工作流 plan = llm_plan(text, slots) if not self.security_review(plan): return handoff_human(wxid, reason="计划审查未过") return workflow_engine.submit(wxid, text)落地建议
按"从下往上"的顺序建设:L1对话理解和L2信息抽取先做,成熟度高、风险低、见效快,团队能在这两层建立对大模型的信任;L3推理在知识库和规则体系成熟后介入;L4规划和L5执行最后开放,且执行权按风险等级逐步放开。判断任何一个新需求该不该上大模型,先问"它落在哪一层、出错代价是什么、有没有校验闭环"。客户消息通过 Eyun 平台 这类个人微信API平台接入,五层能力在自建AI服务中按层实现、独立监控,各消息类型的回调结构参考 Eyun 开发文档。