卸下历史的包袱:SKILL.state 显式状态引擎如何让大模型智能体“轻装远行”
谷歌(Google LLC)和普渡大学(Purdue University)联合发布一种名为SKILL.state的新型智能体运行架构,旨在解决长文本模型在处理复杂、长期任务时常见的上下文膨胀和性能衰减问题。与传统不断追加对话历史的方法不同,该系统利用显式的结构化执行状态来取代冗长的对话记录,在每一步操作后都会丢弃中间推理过程。研究表明,这种方法能够将提示词规模维持在常数级水平,并在显著降低令牌(Token)消耗的同时,提升任务处理的准确性与鲁棒性。通过在仓储管理、软件开发及各类公开基准测试中的验证,该架构证明了其在长周期任务扩展和环境噪声抵御方面的显著优势。这种从“重构历史”向“维护状态”的范式转变,为构建高效、低成本的自主智能体系统提供了新的技术路径。
核心观点
- 现有智能体运行时的局限性:当前主流的 LLM 智能体运行时几乎普遍采用“对话式执行模型”。在长周期(Long-Horizon)任务中,运行时不断向上下文追加观察、动作和中间推理,导致 Prompt 长度随步骤呈二次方阶 O(T2)O(T2) 级累积膨胀,极大地增加了 Token 消耗和推理成本,并容易引发由于历史冗余信息积累而导致的上下文毒化和注意力漂移(Attention Drag)。
- SKILL.state 的状态转移机制:论文提出了 SKILL.state 运行时架构,将传统的“追加式对话历史”重构为“显式的、可变的结构化执行状态(ΣtΣt)”。在每个执行步骤中,模型只接收三项输入:不可变的技能规范(PP)、当前的结构化执行状态(ΣtΣt)和最新的环境观察(OtOt)。
- 即时丢弃中间推理:中间推理过程(如 Chain-of-Thought)仅作为产生状态更新和确定下一步动作的临时计算载体,一旦状态 patch 验证并更新后,这些推理轨迹会被立即丢弃,不留存在后续的 Prompt 中。这一设计实现了渐近有界 O(1)O(1) 的单步 Prompt 大小以及线性 O(T)O(T) 的累计 Token 复杂度。
- 外部环境漂移的零步恢复:当外部环境发生静默漂移(即环境在智能体动作之外被修改)时,依赖历史的系统由于受先前 Prompt 历史的误导会持续产生幻觉并需要多步调整,而 SKILL.state 仅依赖当前观察和显式状态,可实现零步即时状态恢复。
- 局限性与充分统计量假设:SKILL.state 假设执行状态能够成为未来执行的充分统计量。若任务场景无法预知固定 Schema、依赖先前未被记录的历史观察、或任务目标本身就需要解释/审计历史轨迹,则该方案并不适用。
关键数据
- 长周期执行扩展性实验(仓库管理领域,使用 Gemini-3-Flash):
- 单步 Prompt 大小保持恒定:随着执行步数从 T=10T=10 扩展至 T=200T=200,SKILL.state 的单步 Prompt 大小始终保持在平坦的1,736 至 1,905 个 Token之间,而基线由于历史累积呈二次方增长。
- 极佳的 Token 节省率:
- 在T=100T=100时,Stateful(LangGraph 风格)基线消耗了 1,062,387 个 Token,而 SKILL.state 仅消耗65,408 个 Token(节省约 16.2 倍)。
- 在T=200T=200时,Memory 风格基线因历史累积膨胀至 6,175,509 个 Token 且准确率仅 0.84,而 SKILL.state 仅消耗122,384 个 Token,且保持0.94 的高准确率。
- 公开交互式基准测试表现:
- InterCode CTF(100 个 Linux Bash 挑战任务):SKILL.state 取得了54.2% 的首轮通过率(Pass@1),相较于最强基线提升了7.8%(比 Stateful 提升 12.4%),并且比 ReAct 风格减少了60.4%的总 Token 消耗。
- Sierra ττ-Bench(企业客服交互测试):
- 在Retail 零售场景下,SKILL.state 的通过率达58.3%(基线仅为 29.9% - 51.7%),总 Token 消耗最少(3.47M)。
- 在Airline 航空场景下(基线单步 Prompt 常超过 11,000 个 Token),SKILL.state 保持了约2,800 个 Token的扁平化 Prompt,实现了32.4% 的最高通过率,比 ReAct 节省40.5%的 Token,比 Stateful 节省45.4%。
- 环境抗噪与状态恢复数据(使用 Gemini-3-Flash):
- 高噪声抗干扰性:在每步注入 50 个无关背景事件的高噪声测试中,普通 Prompt (ReAct) 的任务完成率降至0.53,而 SKILL.state 依然保持了0.98的极佳准确率。
- 即时恢复零延时:在模拟外部物理状态漂移测试中(例如物品被静默移走),传统的 Prompt、Memory 和 Stateful 基线由于历史文本误导,需要5 到 8 步(在软件仓库实验中甚至需要8 到 14 步)才能消除幻觉回归正常,而 SKILL.state 在所有漂移场景中均保持了0 步恢复。
- Token 预算控制对比:
- 将所有运行时限定在与 SKILL.state 相同的硬性 Token 预算(~1,800 tokens,步数 T=100T=100)下时,滑动窗口截断(Truncated)由于遗失早期分配信息,准确率骤降至0.18;使用 LLMLingua 统计压缩仅得0.22;而 SKILL.state 依靠结构化状态能维持0.94 的高分,证明结构化状态具有无法被统计压缩替代的精确依赖保存能力。
- 开源模型错误分类(Gemma-4-31B at T=100T=100):
- 针对开源大模型在长周期中出现的失效原因分析显示:68%的失效源自过早的状态覆写/删除(即模型在更新状态时遗漏了已有 Key,未能进行原地 merge);20%源于Schema 理解和类型强转问题;仅有12%是由于JSON 语法及格式错误。
https://arxiv.org/html/2608.26263v2