☰
Claude Code与Codex加载Skills全对比:SkillsBench源码级审计Agent技能调用面
2026/10/11 6:07:15 网站建设 项目流程
  • 人工智能
  • 大模型
  • AI 评测
  • Agent 评测

【免费下载链接】skillsbench

SkillsBench evaluates how well skills work and how effective agents are at using them.

项目地址:https://gitcode.com/gh_mirrors/sk/skillsbench
点击查看免费下载

SkillsBench 是首个专门评估 AI Agent 技能(Skills)使用效果的基准测试项目。本文基于它对各 Agent 框架(harness)的源码级审计,带你快速看懂:Claude Code 和 Codex 到底是如何加载 Skills 的——一个把技能做成"一等工具",另一个却故意不用工具调用,而是把技能内容直接注入提示词。理解这两种"技能调用面"(skill invocation surface)的差异,是看懂 Agent 技能生态的第一步 🧩。

什么是 Skills,为什么加载方式很重要

Skills 是"模块化文件夹":由SKILL.md指令文件、脚本和资源组成,教 Agent"该怎么做"某类专业任务,而不是简单地"能用哪个工具"。

听起来简单的 Skills,在不同框架里的"出场方式"却截然不同。这直接决定了两件事:

  1. 模型能不能可靠地"用上"技能——技能描述是否始终在上下文中?
  2. 评估者能不能"数清"技能被用了——轨迹(trajectory)里有没有可审计的信号?

Claude Code 与 Codex 加载 Skills 的核心差异

先看结论速览表 📊

维度Claude CodeCodex
激活方式模型从描述列表自动选择 +/skill-name斜杠命令$skill-name提及 或 命令模式隐式匹配
正文投递工具调用观测(tool-call observation)以<skill>标记的 user 角色文本片段注入
轨迹事件有Skill(name=…)工具调用,可 grep没有,只有文本片段;隐式触发仅进分析计数器
Frontmatter 支持全量支持,最丰富超集仅识别name+description
每技能权限allowed-tools强制执行兄弟文件agents/openai.yaml策略控制
发现路径~/.claude/skills/、<proj>/.claude/skills/、插件目录仓库根向上遍历的.agents/skills/、~/.agents/skills/等

一句话概括:Claude Code 是参考实现——技能是带权限门的一等工具;Codex 刻意不做工具——技能是"提示词注入",但拥有最丰富的激活模型(提及 + 命令模式隐式匹配)。

源码级审计:Codex 的"注入式"加载

Codex 的注入逻辑在codex-rs/core-skills/src/injection.rs中:匹配到技能后读取SKILL.md全文,打包成SkillInjection,再以固定标记包裹:

const START_MARKER: &'static str = "<skill>"; const END_MARKER: &'static str = "</skill>"; // 渲染为 user 角色片段:<name>技能名</name><path>路径</path> + 正文

这意味着在对话轨迹里,Codex 的技能使用不会留下工具调用记录。想准确统计它的技能调用次数,只能依赖带外的codex.skill.injected分析计数器——在沙箱化评测中这基本不可得,所以纯轨迹分析会系统性低估 Codex 的技能使用率⚠️。

而 Claude Code 的技能调用则是一条干净利落的Skill(name=…)工具调用事件,评估者直接 grep 轨迹即可,可靠性最高。

实测数据:两种加载方式下 Skills 都有效

加载机制不同,但结论一致:给 Agent 配上 Skills 后,得分普遍提升 13~23 个百分点:

审计文档与延伸阅读

以上对比均出自 SkillsBench 对 5 大 harness(claude-code、opencode、openhands、codex、pi)的源码级审计,审计结论附完整源码证据(文件路径 + 版本),值得逐行研读:

  • 审计核心文档:docs/harnesses/skill-invocation-surfaces.md
  • 审计方法说明:docs/harnesses/README.md
  • 实验配置(claude-code / codex 的 with-skills 与 without 对照):experiments/configs/
  • 任务结构示例(environment/skills 目录约定):tasks/offer-letter-generator/

对评估者的实用结论

  • Claude Code、opencode、openhands:技能调用 = 工具调用事件,轨迹可审计 ✅
  • Codex:需 grep user 角色文本中的<skill>标记,且会漏掉隐式命令匹配触发的场景(partial 可靠)
  • 这也是 SkillsBench 跨框架对比结果时必须注意的"测量偏差"来源,阅读其排行榜数据时可留意这一点

理解了"技能调用面"的差异,你就掌握了 Agent 技能评估的第一把钥匙——同样的 Skills,在不同框架里既是不同的交互体验,也是不同的测量对象 🔑。

  • 人工智能
  • 大模型
  • AI 评测
  • Agent 评测

【免费下载链接】skillsbench

SkillsBench evaluates how well skills work and how effective agents are at using them.

项目地址:https://gitcode.com/gh_mirrors/sk/skillsbench
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询