如何快速掌握 Everything Claude Code 验证循环:pass@k 与 pass^k 指标、检查点评测实战解析
【免费下载链接】everything-claude-code-zheverything-claude-code 中文翻译项目:完整的 Claude Code 配置集合(agents, skills, hooks, commands, rules, MCPs)。源自 Anthropic 黑客松获胜者的实战配置,助力中文工程师高效理解与使用 Claude Code。项目地址: https://gitcode.com/gh_mirrors/ev/everything-claude-code-zh
Everything Claude Code 中文翻译版(everything-claude-code-zh)是源自 Anthropic 黑客松获胜者的完整 Claude Code 配置集合,涵盖 agents、skills、hooks、commands 与 MCP。本篇聚焦其中的验证循环(Verification Loop)体系:如何通过/verify六阶段验证、pass@k与pass^k两大可靠性指标、/checkpoint检查点评测,让 AI 智能体的产出可度量、可回归、可放心提交。
一、为什么需要验证循环?
让 AI 写代码容易,但"AI 说完成了"≠"真的完成了"。验证循环要解决的核心问题就一句话:用可重复、可度量的标准,判断 AI 的产出是否合格。
Everything Claude Code 把这套思路沉淀为三个命令 + 两个技能,形成闭环:
| 组件 | 作用 | 文件位置 |
|---|---|---|
/verify命令 | 对代码库做全面质量检查 | commands/verify.md |
/eval命令 | 评测驱动开发,量化可靠性 | commands/eval.md |
/checkpoint命令 | 创建/对比检查点 | commands/checkpoint.md |
| 验证循环技能 | 六阶段深度验证流程 | skills/verification-loop/SKILL.md |
| 评测工具链技能 | EDD 框架与指标体系 | skills/eval-harness/SKILL.md |
二、/verify六阶段验证:从构建到安全扫描
验证循环技能 定义了严格的顺序执行流程,任何一环失败都会"熔断"停止:
- 构建验证— 跑不通就停下修好,绝不带病前进
- 类型检查— 报告所有类型错误(如
file:line精确定位) - Lint 检查— 捕获代码风格与潜在坏味道
- 测试套件— 报告通过数/失败数/覆盖率,目标 ≥80%(详见 commands/test-coverage.md 的缺口补全方法)
- 安全扫描— 搜索泄露的密钥、残留的
console.log - 变更审查(Diff Review)— 逐文件检查非预期变更与缺失的错误处理
最终输出一张验证报告,一眼看出能否提交 PR:
构建 (Build): 通过 类型 (Types): 通过 (0 个错误) 测试 (Tests): 通过 (42/42, 83% 覆盖率) 安全 (Security): 通过 总体评价: 已就绪提交 PR ✅💡 小技巧:
/verify quick只跑构建+类型检查,适合开发中途快速自检;/verify pre-pr则加上安全扫描,适合提交前最后一道关(见 commands/verify.md)。
三、pass@k 与 pass^k:读懂 AI 智能体的"可靠性分数"
这是整个评测体系最有价值的一对指标,定义在 skills/eval-harness/SKILL.md 中。
pass@k:k 次尝试中至少一次成功
衡量"给它机会,它能不能做出来":
- pass@1= 首次尝试成功率(最严格)
- pass@3= 3 次内成功一次的比率
- 项目推荐目标:pass@3 > 90%
pass^k:k 次尝试全部成功(注意是乘号,不是 at)
衡量"它是不是稳定可靠":
- pass^3= 连续 3 次都成功
- 典型用于回归评测与关键路径,目标是pass^3 = 100%
两者直觉上的差别:
| 指标 | 语义 | 适用场景 |
|---|---|---|
pass@k | k 次里至少 1 次成功 | 能力评测(新任务能不能做) |
pass^k | k 次全部成功 | 回归评测(老功能稳不稳) |
打个比方:一个 pass@3 = 90% 的智能体可能只是"偶尔靠谱";而 pass^3 = 100% 才代表"次次都能交付"。生产环境要的是后者。
四、检查点评测实战:/checkpoint三步走
检查点(Checkpoint)是验证循环的"存档点"——在关键节点记录状态,之后随时对比。commands/checkpoint.md 支持三种操作:
1️⃣ 创建检查点/checkpoint create "core-done"
- 先跑
/verify quick确认当前状态干净 - 生成 git 提交并记录到
.claude/checkpoints.log
2️⃣ 验证检查点/checkpoint verify "core-done"
- 自动对比四项核心数据:
- 新增/修改的文件数
- 测试通过率变化(
+Y passed / -Z failed) - 代码覆盖率变化(
+X% / -Y%) - 构建是否仍通过
3️⃣ 列出检查点/checkpoint list
- 显示所有检查点的名称、时间戳、Git SHA 与状态(当前/落后/超前)
典型工作流(摘自官方文档):
开始 → create "feature-start" 实现 → create "core-done" 测试 → verify "core-done" 重构 → create "refactor-done" 提PR → verify "feature-start"🎯 实战建议:重构之前
create一个检查点,重构完verify一次。如果测试通过率下降,你立刻知道回退到哪个点。
五、/eval评测报告:从定义到发布的完整闭环
commands/eval.md 提供了四个子命令,对应评测驱动开发(EDD)的完整周期:
/eval define <name>—编码前定义成功标准(能力评测 + 回归评测清单)/eval check <name>— 开发中随时运行,记录每项 PASS/FAIL/eval report <name>— 生成含 pass@1 / pass@3 / pass^3 指标的完整报告/eval list— 总览所有功能的评测进度
报告末尾会给出明确建议:可发布(SHIP)/ 需改进(NEEDS WORK)/ 阻塞(BLOCKED),消除"到底能不能上"的模糊判断。
评分器分三类,按需组合使用:
| 评分器 | 特点 | 典型用途 |
|---|---|---|
| 基于代码 | 确定性检查,最可靠 | 构建是否成功、测试是否通过 |
| 基于模型 | Claude 按 1-5 分评分 | 代码结构、边缘情况处理 |
| 人工评审 | 标注 HUMAN REVIEW REQUIRED | 安全相关变更绝不全自动化 |
六、7 条最佳实践(直接抄作业)
- 在编码前定义评测— 强制想清楚成功标准
- 频繁运行评测— 回归要尽早发现
- 随时间跟踪 pass@k— 监控可靠性趋势
- 优先用代码评分器— 确定性优于概率性
- 安全相关必须人工评审— 绝不完全自动化
- 保持评测快速— 慢评测没人会跑
- 评测与代码一同版本控制— 评测是一等公民资产
📌 延伸阅读:会话结束后,commands/learn-eval.md 还能把高价值模式自评打分后沉淀为可复用技能,形成"评测 → 验证 → 学习"的完整飞轮。
总结
Everything Claude Code 验证循环的本质,是把"AI 说做完了"变成"数据说做完了":
/verify回答"代码现在健康吗?"——六阶段熔断式检查- pass@k / pass^k回答"AI 有多可靠?"——能力看前者,回归看后者
/checkpoint回答"比上次退步了吗?"——可对比、可回退的存档点
三者组合,就是 AI 辅助开发时代的质量门禁。配置全部开箱即用,建议直接从 skills/verification-loop/SKILL.md 开始阅读,把验证习惯固化进你的日常工作流。
【免费下载链接】everything-claude-code-zheverything-claude-code 中文翻译项目:完整的 Claude Code 配置集合(agents, skills, hooks, commands, rules, MCPs)。源自 Anthropic 黑客松获胜者的实战配置,助力中文工程师高效理解与使用 Claude Code。项目地址: https://gitcode.com/gh_mirrors/ev/everything-claude-code-zh
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考