☰
谷歌WikiSkill论文精读:模型可以换经验留下来,9B反超27B
2026/9/29 20:04:48 网站建设 项目流程

谷歌 WikiSkill 论文深读:模型可以换,经验留下来,9B 反超 27B

调研日期:2026-09-28 · 论文:WikiSkill,arXiv 2608.27454,Google Research + 弗吉尼亚理工 2026-08 发布

公众号上读到一篇讲「谷歌 WikiSkill」的文章:一个 90 亿参数模型,带上从任务成败中反复修订的技能,在五项基准上平均 47.4%,跑赢了没有技能加持的 270 亿参数模型(39.4%)——**模型权重没变,做事的方法变了。**这类"把经验沉淀成 Agent 技能"的论文这几年很热,但 WikiSkill 的价值在于它真正把"经验"做成了可独立、持续更新的知识层。我把论文全文核对了一遍,这篇是完整解读。

一、核心结论:经验果然「存得下来、能反超、还能继承」

论文来自 Google Research 与弗吉尼亚理工大学,2026-08-27 发布(arXiv 2608.27454),标题即《WikiSkill: Compiling Agent Experience into Persistent…》。一句话:先针对不同任务离线演化技能,再让 Agent 带着这些方法接受测试。

观测数据
9B 带技能 vs 27B 无技能47.4% vs 39.4%(5 基准平均)
9B 无技能(自身对照)未达标基线
27B 也带技能63.3%(更强模型同样受益)
Qwen 系列增益4B +12.3、9B +17.5、27B +23.9 个百分点
电子表格(最突出)27B 从 40.8% →81.7%(约两倍)

研究覆盖数学推理、网页搜索、电子表格、长文档问答、文本家务模拟五类;技能按每项基准分别演化,训练/验证/测试互不重叠,每种配置从空技能集跑三次取平均。

二、经验三层结构:Raw → Wiki → Skills

论文把"积累经验"落成了三层明确存储:

层级存什么谁用
Raw不可改写的执行轨迹(供回溯)演化环节查证
Wiki错误模式、有效策略、修改历史(持续整理)提议者分析、维护
Skills当前采用的完整工作方法(SKILL.md + 脚本 + 参考)执行 Agent

三个 Agent 分工:执行者按当前技能做任务;维护者对照成功/失败轨迹,检查具体操作与错误原因;提议者查阅 Wiki + 原始记录,基于标准答案与成败摘要提出修改。默认配置里,执行 Agent 用 Skills,Wiki 供演化分析。

三、"技能会退、教训不退"的迭代机制

论文最有意思的一段是:在 ALFWorld 文本家务模拟里,Qwen 反复取物、检查、移动,一直不推进。第 0 轮提了个宽泛的"目标导向行动"技能,验证没提高即被拒;第 1 轮参考失败记录改成更具体的防循环规则(“不要把物品放回原来的位置”)通过验证;第 4 轮再补充"同一物品同一操作只执行一次"。

规则管理很清晰:每轮只对单个技能做新增或局部修改,放独立验证集评估,分数必须严格超过历史最佳才接受;打平或下降就回退。但 Wiki 不随技能回滚——修改内容、验证分数、接受/拒绝结果都保留,为下一轮留下线索。这解释了为什么网页搜索任务里 28% 的获准修改出现在第 5–7 轮:前期积累仍能催生有效新方法。

四、经验真能跨"模型传"吗?既能,也会传错

论文做了直接交换实验,双向都有结论:

任务·执行模型自身技能换用其它模型技能
ALFWorld · Qwen-9B63.4%用 27B 技能70.2%
数学 · Gemma-31B56.7%用 4B 技能73.1%
表格 · Gemini-Flash无技能 50.5%用 4B 技能18.1%(明显倒退)

长文档问答里更典型:4B 用自己演化的技能从 30.2% -> 28.5%,同一套技能交给 27B 却从 42.1% 升到 52.9%。"发现有用方法"和"把方法执行到位"是两种能力。但表格任务的负迁移也提醒:4B 为了避免错误发展出的单行 Python、字符串转换等具体补丁,反而限制了 Gemini 用完整脚本——经验含可复用方法和为某模型量身定做的补丁,换执行者必须重新验证。

五、局限性(论文自己的坦诚)

  • 验证集每项只有 10–40 题,距离真实工作长期稳定进化还有距离
  • 实验把当前技能全文直接放进 prompt,没检验技能库扩大后的检索与触发
  • 只接受立即提分的修改,可能放弃有助于后续改进的铺垫
  • Wiki 无自动修剪机制,长期运行怎么处置冗余/过期知识未知
  • 成本不低:每轮仅维护 Wiki + 提修改就约 11–21 次模型调用
  • 数小时、数百次环境操作的超长任务尚未覆盖

关联与启发

WikiSkill 的"Raw→Wiki→Skill"三层结构,和我一直在做的人持久化知识库思路高度同构:都主张"先把经验编译成独立、持续更新的知识,再沉淀为可复用技能"。Karpathy 的 LLM Wiki 思路(保留已整理知识,让后续工作接着前面积累往下做)在这篇论文里有了更工程化的落地。

一句话结论

WikiSkill(arXiv 2608.27454,Google + 弗吉尼亚理工)用「原始轨迹 → 经验 Wiki → 执行技能」三层结构 + 三 Agent 分工 + 严格验证/回退,把 Agent 经验首次做成可查证、可继承、可跨模型复用的知识资产,9B 反超 27B 实证了"经验本身也是竞争力";但离生产级还有检索、修剪、长任务、成本四道坎——方向正确,价值在"经验货币化"这个命题。

局限

  • 依据是论文 + 多篇知乎/技术博客交叉,未复现实验(无 GPU 环境跑 9B/27B)
  • 未做本机 demo(论文为研究性工作,无可直接运行的可复现工程包)
  • 具体单任务数据来自论文表,非本机实测

下一篇预告:我把 WikiSkill 的「Raw→Wiki→Skill」理念映射到日常 Agent 工作流,写一份普通人也能用上的「Agent 经验沉淀」落地模板。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询