☰
如何快速掌握 Everything Claude Code 验证循环:pass@k 与 pass^k 指标、检查点评测实战解析
2026/10/9 2:46:27 网站建设 项目流程

如何快速掌握 Everything Claude Code 验证循环:pass@k 与 pass^k 指标、检查点评测实战解析

【免费下载链接】everything-claude-code-zheverything-claude-code 中文翻译项目:完整的 Claude Code 配置集合(agents, skills, hooks, commands, rules, MCPs)。源自 Anthropic 黑客松获胜者的实战配置,助力中文工程师高效理解与使用 Claude Code。项目地址: https://gitcode.com/gh_mirrors/ev/everything-claude-code-zh

Everything Claude Code 中文翻译版(everything-claude-code-zh)是源自 Anthropic 黑客松获胜者的完整 Claude Code 配置集合,涵盖 agents、skills、hooks、commands 与 MCP。本篇聚焦其中的验证循环(Verification Loop)体系:如何通过/verify六阶段验证、pass@k与pass^k两大可靠性指标、/checkpoint检查点评测,让 AI 智能体的产出可度量、可回归、可放心提交。


一、为什么需要验证循环?

让 AI 写代码容易,但"AI 说完成了"≠"真的完成了"。验证循环要解决的核心问题就一句话:用可重复、可度量的标准,判断 AI 的产出是否合格。

Everything Claude Code 把这套思路沉淀为三个命令 + 两个技能,形成闭环:

组件作用文件位置
/verify命令对代码库做全面质量检查commands/verify.md
/eval命令评测驱动开发,量化可靠性commands/eval.md
/checkpoint命令创建/对比检查点commands/checkpoint.md
验证循环技能六阶段深度验证流程skills/verification-loop/SKILL.md
评测工具链技能EDD 框架与指标体系skills/eval-harness/SKILL.md

二、/verify六阶段验证:从构建到安全扫描

验证循环技能 定义了严格的顺序执行流程,任何一环失败都会"熔断"停止:

  1. 构建验证— 跑不通就停下修好,绝不带病前进
  2. 类型检查— 报告所有类型错误(如file:line精确定位)
  3. Lint 检查— 捕获代码风格与潜在坏味道
  4. 测试套件— 报告通过数/失败数/覆盖率,目标 ≥80%(详见 commands/test-coverage.md 的缺口补全方法)
  5. 安全扫描— 搜索泄露的密钥、残留的console.log
  6. 变更审查(Diff Review)— 逐文件检查非预期变更与缺失的错误处理

最终输出一张验证报告,一眼看出能否提交 PR:

构建 (Build): 通过 类型 (Types): 通过 (0 个错误) 测试 (Tests): 通过 (42/42, 83% 覆盖率) 安全 (Security): 通过 总体评价: 已就绪提交 PR ✅

💡 小技巧:/verify quick只跑构建+类型检查,适合开发中途快速自检;/verify pre-pr则加上安全扫描,适合提交前最后一道关(见 commands/verify.md)。

三、pass@k 与 pass^k:读懂 AI 智能体的"可靠性分数"

这是整个评测体系最有价值的一对指标,定义在 skills/eval-harness/SKILL.md 中。

pass@k:k 次尝试中至少一次成功

衡量"给它机会,它能不能做出来":

  • pass@1= 首次尝试成功率(最严格)
  • pass@3= 3 次内成功一次的比率
  • 项目推荐目标:pass@3 > 90%

pass^k:k 次尝试全部成功(注意是乘号,不是 at)

衡量"它是不是稳定可靠":

  • pass^3= 连续 3 次都成功
  • 典型用于回归评测与关键路径,目标是pass^3 = 100%

两者直觉上的差别:

指标语义适用场景
pass@kk 次里至少 1 次成功能力评测(新任务能不能做)
pass^kk 次全部成功回归评测(老功能稳不稳)

打个比方:一个 pass@3 = 90% 的智能体可能只是"偶尔靠谱";而 pass^3 = 100% 才代表"次次都能交付"。生产环境要的是后者。

四、检查点评测实战:/checkpoint三步走

检查点(Checkpoint)是验证循环的"存档点"——在关键节点记录状态,之后随时对比。commands/checkpoint.md 支持三种操作:

1️⃣ 创建检查点/checkpoint create "core-done"

  • 先跑/verify quick确认当前状态干净
  • 生成 git 提交并记录到.claude/checkpoints.log

2️⃣ 验证检查点/checkpoint verify "core-done"

  • 自动对比四项核心数据:
    • 新增/修改的文件数
    • 测试通过率变化(+Y passed / -Z failed)
    • 代码覆盖率变化(+X% / -Y%)
    • 构建是否仍通过

3️⃣ 列出检查点/checkpoint list

  • 显示所有检查点的名称、时间戳、Git SHA 与状态(当前/落后/超前)

典型工作流(摘自官方文档):

开始 → create "feature-start" 实现 → create "core-done" 测试 → verify "core-done" 重构 → create "refactor-done" 提PR → verify "feature-start"

🎯 实战建议:重构之前create一个检查点,重构完verify一次。如果测试通过率下降,你立刻知道回退到哪个点。

五、/eval评测报告:从定义到发布的完整闭环

commands/eval.md 提供了四个子命令,对应评测驱动开发(EDD)的完整周期:

  • /eval define <name>—编码前定义成功标准(能力评测 + 回归评测清单)
  • /eval check <name>— 开发中随时运行,记录每项 PASS/FAIL
  • /eval report <name>— 生成含 pass@1 / pass@3 / pass^3 指标的完整报告
  • /eval list— 总览所有功能的评测进度

报告末尾会给出明确建议:可发布(SHIP)/ 需改进(NEEDS WORK)/ 阻塞(BLOCKED),消除"到底能不能上"的模糊判断。

评分器分三类,按需组合使用:

评分器特点典型用途
基于代码确定性检查,最可靠构建是否成功、测试是否通过
基于模型Claude 按 1-5 分评分代码结构、边缘情况处理
人工评审标注 HUMAN REVIEW REQUIRED安全相关变更绝不全自动化

六、7 条最佳实践(直接抄作业)

  1. 在编码前定义评测— 强制想清楚成功标准
  2. 频繁运行评测— 回归要尽早发现
  3. 随时间跟踪 pass@k— 监控可靠性趋势
  4. 优先用代码评分器— 确定性优于概率性
  5. 安全相关必须人工评审— 绝不完全自动化
  6. 保持评测快速— 慢评测没人会跑
  7. 评测与代码一同版本控制— 评测是一等公民资产

📌 延伸阅读:会话结束后,commands/learn-eval.md 还能把高价值模式自评打分后沉淀为可复用技能,形成"评测 → 验证 → 学习"的完整飞轮。

总结

Everything Claude Code 验证循环的本质,是把"AI 说做完了"变成"数据说做完了":

  • /verify回答"代码现在健康吗?"——六阶段熔断式检查
  • pass@k / pass^k回答"AI 有多可靠?"——能力看前者,回归看后者
  • /checkpoint回答"比上次退步了吗?"——可对比、可回退的存档点

三者组合,就是 AI 辅助开发时代的质量门禁。配置全部开箱即用,建议直接从 skills/verification-loop/SKILL.md 开始阅读,把验证习惯固化进你的日常工作流。

【免费下载链接】everything-claude-code-zheverything-claude-code 中文翻译项目:完整的 Claude Code 配置集合(agents, skills, hooks, commands, rules, MCPs)。源自 Anthropic 黑客松获胜者的实战配置,助力中文工程师高效理解与使用 Claude Code。项目地址: https://gitcode.com/gh_mirrors/ev/everything-claude-code-zh

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询