- 人工智能
- 大模型
- AI 评测
- Agent 评测
【免费下载链接】skillsbench
SkillsBench evaluates how well skills work and how effective agents are at using them.
SkillsBench 是首个专门评估 AI Agent 技能(Skills)使用效果的基准测试项目。本文基于它对各 Agent 框架(harness)的源码级审计,带你快速看懂:Claude Code 和 Codex 到底是如何加载 Skills 的——一个把技能做成"一等工具",另一个却故意不用工具调用,而是把技能内容直接注入提示词。理解这两种"技能调用面"(skill invocation surface)的差异,是看懂 Agent 技能生态的第一步 🧩。
什么是 Skills,为什么加载方式很重要
Skills 是"模块化文件夹":由SKILL.md指令文件、脚本和资源组成,教 Agent"该怎么做"某类专业任务,而不是简单地"能用哪个工具"。
听起来简单的 Skills,在不同框架里的"出场方式"却截然不同。这直接决定了两件事:
- 模型能不能可靠地"用上"技能——技能描述是否始终在上下文中?
- 评估者能不能"数清"技能被用了——轨迹(trajectory)里有没有可审计的信号?
Claude Code 与 Codex 加载 Skills 的核心差异
先看结论速览表 📊
| 维度 | Claude Code | Codex |
|---|---|---|
| 激活方式 | 模型从描述列表自动选择 +/skill-name斜杠命令 | $skill-name提及 或 命令模式隐式匹配 |
| 正文投递 | 工具调用观测(tool-call observation) | 以<skill>标记的 user 角色文本片段注入 |
| 轨迹事件 | 有Skill(name=…)工具调用,可 grep | 没有,只有文本片段;隐式触发仅进分析计数器 |
| Frontmatter 支持 | 全量支持,最丰富超集 | 仅识别name+description |
| 每技能权限 | allowed-tools强制执行 | 兄弟文件agents/openai.yaml策略控制 |
| 发现路径 | ~/.claude/skills/、<proj>/.claude/skills/、插件目录 | 仓库根向上遍历的.agents/skills/、~/.agents/skills/等 |
一句话概括:Claude Code 是参考实现——技能是带权限门的一等工具;Codex 刻意不做工具——技能是"提示词注入",但拥有最丰富的激活模型(提及 + 命令模式隐式匹配)。
源码级审计:Codex 的"注入式"加载
Codex 的注入逻辑在codex-rs/core-skills/src/injection.rs中:匹配到技能后读取SKILL.md全文,打包成SkillInjection,再以固定标记包裹:
const START_MARKER: &'static str = "<skill>"; const END_MARKER: &'static str = "</skill>"; // 渲染为 user 角色片段:<name>技能名</name><path>路径</path> + 正文这意味着在对话轨迹里,Codex 的技能使用不会留下工具调用记录。想准确统计它的技能调用次数,只能依赖带外的codex.skill.injected分析计数器——在沙箱化评测中这基本不可得,所以纯轨迹分析会系统性低估 Codex 的技能使用率⚠️。
而 Claude Code 的技能调用则是一条干净利落的Skill(name=…)工具调用事件,评估者直接 grep 轨迹即可,可靠性最高。
实测数据:两种加载方式下 Skills 都有效
加载机制不同,但结论一致:给 Agent 配上 Skills 后,得分普遍提升 13~23 个百分点:
审计文档与延伸阅读
以上对比均出自 SkillsBench 对 5 大 harness(claude-code、opencode、openhands、codex、pi)的源码级审计,审计结论附完整源码证据(文件路径 + 版本),值得逐行研读:
- 审计核心文档:docs/harnesses/skill-invocation-surfaces.md
- 审计方法说明:docs/harnesses/README.md
- 实验配置(claude-code / codex 的 with-skills 与 without 对照):experiments/configs/
- 任务结构示例(environment/skills 目录约定):tasks/offer-letter-generator/
对评估者的实用结论
- Claude Code、opencode、openhands:技能调用 = 工具调用事件,轨迹可审计 ✅
- Codex:需 grep user 角色文本中的
<skill>标记,且会漏掉隐式命令匹配触发的场景(partial 可靠) - 这也是 SkillsBench 跨框架对比结果时必须注意的"测量偏差"来源,阅读其排行榜数据时可留意这一点
理解了"技能调用面"的差异,你就掌握了 Agent 技能评估的第一把钥匙——同样的 Skills,在不同框架里既是不同的交互体验,也是不同的测量对象 🔑。
- 人工智能
- 大模型
- AI 评测
- Agent 评测
【免费下载链接】skillsbench
SkillsBench evaluates how well skills work and how effective agents are at using them.
相关推荐
garden-skills:面向 Claude Code / Cursor / Codex 的生产级 Agent Skills 精选合集与安装实践指南
garden skills:面向 Claude Code / Cursor / Codex 的生产级 Agent Skills 精选合集与安装实践指南 本指南以
人工智能AI 技能/插件提示工程Trail of Bits Skills 插件市场指南:在 Claude Code 与 Codex 中部署 AI 安全审计技能库
Trail of Bits Skills 插件市场指南:在 Claude Code 与 Codex 中部署 AI 安全审计技能库 导读 本文围绕 Trail o
AI 技能AI 插件应用安全网络安全AI 评测OpenHuman Agent Harness 资源占用评测:与 Codex CLI、Claude Code、ZeroClaw、Hermes 的可信度分级对比
OpenHuman Agent Harness 资源占用评测:与 Codex CLI、Claude Code、ZeroClaw、Hermes 的可信度分级对比
人工智能AI 应用本地部署AI Agent交互助手深度研究
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考