Agent Skills for Context Engineering 版本演进全记录:从 13 技能基线到 2.5.0 的可测量路由基准体系
【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering
本文为技术型作者基于当前仓库的 CHANGELOG.md 所写,完整覆盖该仓库从 2.0.0 基线语料到 2.5.0 的七个版本变更:研究操作系统(mechanism registry、run 状态机、连续循环)、首个端到端执行的路由基准测试(600 次运行 × 4 个前沿模型)、跨平台 YAML frontmatter 修复,以及self-improvement-loops与long-horizon-prompting两个新技能的落地与语料接线。读完后,你将掌握该项目"先写描述、再用数据证明路由正确"的工程闭环,以及如何在自己的技能库中复用其确定性验证门、描述重写与边界回归测试方法。
版本总览:语义化版本 + "技能内容即数据"
CHANGELOG 开篇声明了本仓库的版本策略:所有显著变更在此记录,版本在可行范围内遵循语义化版本(semantic versioning),技能内容(skill content)被视为数据而非库代码——这解释了为何新增技能是 Minor 版本(2.3.0 → 2.4.0 → 2.5.0 各对应一个第 15/16/17 个技能),而修复类变更走 Patch(2.3.0 → 2.3.1)。
完整时间线如下:
| 版本 | 日期 | 主题 |
|---|---|---|
| 2.0.0 | 早期 | 13 个技能的基线语料,以单一 Claude Code 插件分发 |
| 2.1.0 | 2026-05-14 | 新增harness-engineering技能;researcher/目录 v1 |
| 2.2.0 | 2026-05-15 | 研究操作系统(机制注册表、run 状态机、连续循环、CI 门) |
| 2.3.0 | 2026-05-15 | 首个带实测基准结果版本:路由基准端到端执行 + 描述重写 |
| 2.3.1 | 2026-06-29 | 跨平台 YAML frontmatter 修复与平台兼容性门 |
| 2.4.0 | 2026-07-08 | 新增self-improvement-loops技能(第 16 个) |
| 2.5.0 | 2026-07-11 | 新增long-horizon-prompting技能(第 17 个) |
该时间线与当前仓库实际状态完全吻合:两份插件清单 .plugin/plugin.json 与 .claude-plugin/marketplace.json 的version字段均为2.5.0,marketplace 清单声明的 17 个技能路径与 README.md 的技能总表一致;根目录 SKILL.md 同样更新为 17 技能口径。
v2.1.0 与 v2.2.0:研究操作系统落地
新增 harness-engineering 技能与 researcher/ v1(2.1.0)
harness-engineering技能:锁定/可编辑表面模型(locked/editable surface model)、持久线程(durable threads)、新颖性门(novelty gates)、回滚、人工审批边界;对应 skills/harness-engineering/SKILL.md。researcher/目录 v1:来源注册表 researcher/source-registry.md、内容与技能/harness 评分细则(researcher/rubrics/)、来源评估 JSON 模板 researcher/templates/source-evaluation.json、技能提案模板 researcher/templates/skill-proposal.md、自主研究循环 runbook 与 PR 就绪 runbook(researcher/runbooks/)。
研究操作系统(2.2.0 Added)
v2.2.0 是本仓库的分水岭:researcher/从一个目录演进为一套基于文件的操作系统,目标是让仓库成为"复利式的事实来源"而非技能文集。CHANGELOG 列出的组件在仓库中均可定位:
- 机制注册表researcher/mechanisms/registry.jsonl:种子版本含 5 个已接受机制(
locked-editable-surfaces、durable-research-thread、deterministic-first-validation、structured-novelty-gate、pairwise-skill-revision)。每条记录含mechanism_id、owning_skill、status、activation_scenario、behavior_change、evidence、failure_modes字段——注册表用"机器可读的行为模式"作为新颖性判断的主信号。 - 机制账本researcher/mechanisms/ledgers/accepted.jsonl 与 researcher/mechanisms/ledgers/rejected.jsonl:append-only 的晋升事件,作为制度记忆。
- 声明溯源researcher/claims/index.jsonl:为
evaluation、multi-agent-patterns、context-optimization、memory-systems、advanced-evaluation、harness-engineering中 6 条易变或基准背书的声明建立来源 URL、证据强度、易变性与复审日期记录。 - 语料索引researcher/corpus/index.json:技能 → 激活场景 → 机制 ID → 声明 ID 的规范机器可读映射。
- 激活回归夹具researcher/fixtures/activation-cases.jsonl:覆盖高风险技能边界对的确定性 prompt。
- 对抗性基准researcher/benchmarks/scenarios/adversarial.jsonl + 金标 researcher/benchmarks/goldens/adversarial-goldens.json:7 个试图"钻循环空子"的场景(重复机制、未检索证据、错误评分算术、自批评分修改、弱证据新颖性)。
- 基准历史researcher/reports/benchmark-history.jsonl:纵向趋势跟踪。
- 成对修订细则与脚本:researcher/rubrics/pairwise-skill-revision.md 与 researcher/scripts/compare_skill_revisions.py。
- Run 状态机:
run-state.json显式迁移链initialized -> retrieved -> evaluated -> proposed -> novelty_checked -> validated -> pr_ready -> closed。仓库保留了种子 run researcher/runs/20260515-035228-executable-autonomous-research-frameworks/ 作为 worked-example 夹具,其 run-state.json 实际包含current_state、close_status、locked_surfaces、editable_surfaces、state_history等字段,印证了状态机设计。
连续循环(2.2.0 Continuous loop)
- 队列基础设施researcher/queue/:inbox、parked、done、quarantine 四类。
- 编排配置researcher/orchestration/config.json:daily/active/parked/failure 四类预算。
- 发现喂入器researcher/scripts/loop_discover.py:从 researcher/discovery/manual-seed.jsonl 读取。
- 循环步进编排器researcher/scripts/loop_step.py:收割已关闭 run、从 inbox 拉取、用 stdlib
urllib检索、在人工评审门处 park。 - 每日运维researcher/scripts/loop_daily.py:跑校验器、基准、激活用例并写出带日期快照。
- 状态面板researcher/scripts/loop_status.py 与 parked 评审面。
- launchd 服务定义researcher/orchestration/launchd/:install/uninstall 脚本与逐脚本包装器。
- 连续运维 runbookresearcher/runbooks/continuous-operation.md。
脚本与 CI(2.2.0)
- researcher/scripts/validate_run.py:逐 run 发布就绪性检查,跳过已关闭 run。
- researcher/scripts/research_loop.py 子命令:
retrieve、evaluate、propose、novelty、validate-run、pr-ready、close、promote-mechanisms。 - researcher/scripts/check_activation_cases.py:确定性激活回归检查器。
- researcher/scripts/run_benchmarks.py:跑确定性门与场景,可选记录历史。
- researcher/scripts/loop_common.py:共享原子写辅助与
fcntl锁。 - CI 工作流 .github/workflows/validate.yml 在每次 push 与 PR 上运行
validate_repo.py --strict、run_benchmarks.py、check_activation_cases.py及 Python 编译检查。当前工作流实际以 Python 3.12 运行,先pip install -r requirements-dev.txt,再对全部 researcher 脚本执行py_compile,随后运行 frontmatter 单元测试。
变更、加固与仓库策略(2.2.0)
- 变更:技能激活面从"关键词触发"重构为 frontmatter 与 README 中的任务边界式描述(task-boundary descriptions),影响全部 14 个已发布技能及 examples/ 示例技能。
validate_repo.py加固项:重复 JSON 键、文档精确同步、评分细则 ID、run 工件、注册表 schema、证据路径、部分检索批准、根级 raw 溯源、claims schema、语料索引一致性、激活用例、基准场景。researcher/scripts/novelty_check.py 改为以机制注册表重叠为主信号、语料重叠为次信号;机制注册表的 evidence 现在可以引用researcher/claims/index.jsonl中的 claim ID。 - 加固:所有队列变更使用临时文件 +
os.replace原子写,并按队列族加fcntl排他锁;read_jsonl容错——坏行隔离到researcher/reports/jsonl-quarantine/而不是崩溃循环;fetch_url仅允许http(s)://且在重定向后二次检查 scheme;已关闭 run 自动从parked.jsonl收割并记入done.jsonl;inbox 锁在init_run期间保持,防止并发loop_step超预算;URL 去重在哈希前做大小写归一。 - 仓库策略:
researcher/runs/*/下的活跃研究 run 是运行时状态、不提交;种子 run20260515-035228-executable-autonomous-research-frameworks保留为 worked-example 夹具。运行时队列与报告文件(researcher/queue/*.jsonl、researcher/reports/下的 logs、snapshots、loop-events、loop-failures、status.md、parked-review.md,以及researcher/queue/.locks/)均被 gitignore。 - 2.2.0 明确不做的事:LLM-judge 适配器(自动推进
retrieved -> evaluated);手动种子文件之外的自动来源发现(Parallel deep research 与 web search 适配器只是配置开关后的占位);日志轮转与基准历史修剪。
v2.3.0:从"写了描述"到"证明路由正确"
CHANGELOG 对 2.3.0 的定位非常明确:首个带实测基准结果、跨四个前沿模型发布的路由基准版本,把闭环从"我们写了技能描述"推进到"我们证明了它们能正确路由"。
阶段 2 路由基准:端到端执行
- 600/600 运行完成:4 个模型(
composer-2、claude-opus-4-7、gpt-5.5、gemini-3.1-pro)× 50 个 prompt × 3 次复现。初始 v2.2.0 基线在 researcher/benchmarks/router/results-published/2026-05-15.md(566/600,v1 runner 中途死掉);描述修复后的更新运行在 researcher/benchmarks/router/results-published/2026-05-15-v2.md,含完整 delta-vs-baseline 表。 - 50 个真值路由 prompt位于 researcher/benchmarks/router/prompts.jsonl,覆盖阳性对照、对抗性边界对、组合技能 prompt 与阴性对照。
- researcher/scripts/render_router_report.py 带
--baseline参数出 delta 报告——当前源码中确有baseline_summary、baseline_confusion、baseline_label等参数与 "## Delta vs baseline" 输出段。 - researcher/benchmarks/router/results-published/README.md 解释"提交摘要 vs gitignore 原始数据"的拆分策略。
加固后的 SDK runner(researcher/benchmarks/sdk-runner/src/)
针对 v1 sweep 静默卡在 566/600 无信号的问题,researcher/benchmarks/sdk-runner/src/ 做了四项加固:
- Resume:启动时扫描目标目录,跳过已有 per-run JSON 的计划项;被杀掉的 sweep 可精确续跑,不浪费额度、不重复运行。
- 有界并发:
--concurrency N同时跑 N 个 agent 调用。600-run sweep 从顺序的约 60 分钟降到并发 4 的约 15 分钟,正确性不变。 - 逐 run 进度日志:每个完成的 run 打印
[N/total] model prompt rep=R status durationMs T1 ETA=duration。 - 格式失败重试:瞬时空响应或不可解析响应在记为格式失败前先重试一次(5 月 19 日 sweep 曾产生瞬时空白输出、重跑即成功,由此加入)。
common.ts中的runConcurrently辅助函数可被未来 runner 复用。源码层面,common.ts 确实实现了带concurrency/noResume标志的 CLI 解析与有界并发执行器,runRouter.ts 在concurrency: 1默认值下调用runConcurrently(remaining, ...)。
数据驱动的技能描述重写
v2.2.0 基线基准暴露了两个路由失败点,针对性重写后:
| 技能 | 重写策略 | Top-1 变化 |
|---|---|---|
context-fundamentals | 改为明确讲概念基础,把操作性工作显式路由到专门技能 | 0.255 → 0.489(+23.4pp) |
project-development | 收紧并加对tool-design的显式交叉引用 | 0.750 → 1.000(达到完美路由) |
tool-design | 收紧并加对project-development的显式交叉引用 | 0.729 → 0.807(+7.8pp) |
技能正文与新描述的对齐
关键前提:路由基准只能看到 frontmatter 的description,因为 runner 使用settingSources: []排除了 SKILL.md 正文。第一次描述重写留下了正文(When to Activate、Practical Guidance、Integration)仍宣称重写前更大范围的问题——一旦技能在生产中真正激活,正文会把 agent 引向操作型工作。于是做了第二轮正文对齐:
- skills/context-fundamentals/SKILL.md:
When to Activate改写为概念触发器 + 显式 do-not-activate 路由;删除操作性小节(文件访问归filesystem-context,上下文预算归context-optimization);Integration改写为覆盖全部 14 个兄弟技能的路由图。内部版本 2.0.0 → 2.1.0。 - skills/tool-design/SKILL.md:锚定工作单元(单个工具或工具目录),列出
project-development、multi-agent-patterns、context-optimization拥有的相邻决策。内部版本 2.0.0 → 2.1.0。 - skills/project-development/SKILL.md:锚定项目形态与流水线,列出
tool-design、context-optimization、multi-agent-patterns、harness-engineering拥有的相邻决策。内部版本 1.1.0 → 1.2.0。
CHANGELOG 特别点明:正文变更不影响路由基准数字(路由只看描述),但影响技能激活后 agent 实际加载的内容;测量这种对齐效果的合适位置是阶段 3(加载完整正文的有效性基准)。
全语料技能强化
三个技能针对性对齐之后,全部 15 个已发布技能按同一标准审计:显式所有权边界、Do not activate路由、可执行实操指导、示例、坑、集成边界、机制覆盖、声明溯源、激活夹具。结果:
- 15 个技能正文全部按范围更新,含
bdi-mental-states与hosted-agents的结构修复、旧技能更强的负向路由、上下文失效模式的更清晰示例、易变基准声明的 claim 背书措辞。 - researcher/mechanisms/registry.jsonl 从 5 扩到 16 个已接受机制,使每个已发布技能至少拥有一个机器可读行为模式。
- 声明溯源从 6 条扩到 12 条,把模糊的 run 摘要来源替换为具体仓库路径(BrowseComp、RULER/lost-in-middle、压缩、d0、Latent Briefing、memory、tool-output 声明)。
- 激活回归覆盖从 14 扩到 19 个用例,
bdi-mental-states、context-degradation、hosted-agents、latent-briefing、multi-agent-patterns等全部有确定性路由覆盖。 validate_repo.py --strict收紧:Core Concepts、Practical Guidance、Examples、References与显式非激活边界从可选变为强制。- template/SKILL.md 更新为新的全语料标准:正文/frontmatter 对齐、机制注册、可执行指导、易变声明的
claim-*溯源。当前模板的 description 与正文中"每个技能正文必须显式声明所有权边界"的要求即源于此轮。 - 无 API 门全部复跑:
validate_repo.py --strict0 错 0 警;researcher/scripts/skill_health.py--strict --no-history语料分从 0.8111/2 个标记技能提升到 0.9117/0 标记;check_activation_cases.py19/19 通过;run_benchmarks.py3 项检查 + 7 个对抗场景通过。 - 复跑付费阶段 2 基准:600/600 可用记录、0 格式失败,发布为 researcher/benchmarks/router/results-published/2026-05-19.md。该报告头部记录 commit、fixture sha256-16(
8f974d930836bc9c)、seed=1、600 次运行与 3 复现,方法学为"15 个技能描述按确定性打乱序注入 prompt,模型返回排序 JSON,top-1/top-3 对expected_primary_skill评分,95% bootstrap 置信区间"。
11 个新边界回归用例
researcher/fixtures/activation-cases.jsonl 从 8 个用例扩到 19 个。前 6 个新用例针对 v2.2.0 基线观察到的具体混淆:activation-fundamentals-vs-degradation、activation-fundamentals-onboarding、activation-fundamentals-vs-optimization、activation-tool-vs-project-structured-output、activation-tool-individual-tool、activation-tool-consolidation。全语料 pass 再补 5 个此前未覆盖技能的用例:activation-bdi-vs-memory、activation-degradation-poisoning、activation-hosted-vs-harness、activation-latent-briefing-vs-memory、activation-multi-agent-topology。这些用例充当绊线(tripwire):任何未来描述变更都要对它们负责。
阶段 1 技能健康(无 API 成本)
researcher/scripts/skill_health.py:逐技能结构评分。脚本头注释自述其设计约束——确定性、不调用任何 LLM、默认不发 HTTP(--check-urls才发),输出写入 gitignore 的researcher/reports/skill-health.json并可选追加skill-health-history.jsonl。基线:语料分 0.8111、15 个技能中 2 个被标记(bdi-mental-states缺必需章节、hosted-agents多项结构问题);强化 pass 后 0.9117、0 标记。
2.3.0 实测结果与诚实的范围保留
按模型 top-1 准确率(基线 → 新描述,600-run sweep,seed=1,fixture sha 8f974d9):
| 模型 | 基线 | 新描述 | Delta |
|---|---|---|---|
| composer-2 | 0.888 | 0.913 | +2.5pp |
| gpt-5.5 | 0.886 | 0.913 | +2.7pp |
| gemini-3.1-pro | 0.886 | 0.925 | +3.9pp |
| claude-opus-4-7 | 0.886 | 0.867 | -2.0pp |
全语料强化 pass 之后(2026-05-19 发布报告)按模型 top-1:Gemini 0.920、Composer 0.913、GPT-5.5 0.913、Claude Opus 4.7 0.840,剩余失败集中在已知歧义/阴性对照 prompt(p046、p048)与context-fundamentals兜底边界。格式合规率 99.5%(3 次失败,全部 Gemini);延迟:Gemini 中位数约 9.1s,其他 3.3–4.2s;总 sweep 成本约 7.20 USD,低于 15 USD 预算上限。
CHANGELOG 的 "Honest scope caveats" 一节值得逐条继承:
context-fundamentals进步大但仍是最弱技能(top-1 0.489),剩余失败把通用 onboarding prompt 路由到了project-development;再来一轮描述 pass 可能推过 0.75。- 两个 prompt 在所有模型上都保持 0.00:p046(Python 重排,阴性对照)与 p048(评估 KV 压缩,真正歧义),应重新打标或移出阳性路由测试。
advanced-evaluation表面回退 -18.3pp,但主要是 v2.2.0 基线在 runner 死于 566/600 时缺了 11 次尝试的伪影;绝对正确数 48 基线 → 47 新。- 阶段 3(带/不带技能加载的真实 agent 任务)仍只是脚手架未执行,是下一步投入。
- run 状态机没有 LLM-judge 适配器;除手动种子外没有自动来源发现。
变更项:版本在 .claude-plugin/marketplace.json、.plugin/plugin.json、根 SKILL.md 从 2.2.0 升到 2.3.0;researcher/benchmarks/PLAN.md 状态表反映阶段 0/1/2 已交付、阶段 3/4 仍为脚手架。
v2.3.1:跨平台 YAML frontmatter 修复
这是一个典型的"文档即接口"问题版本:15 个已发布技能中 11 个的description值未加引号且含冒号,被严格 YAML 解析器(Cursor、Claude Code、Codex、Agent Skills 校验器)拒绝。修复内容:
- YAML 安全引号:全部技能描述改为 YAML 安全引用;
memory-systems不再使用被仓库校验器误读为">"的折叠块标量。 - 共享 frontmatter 解析器:新增 researcher/scripts/skill_frontmatter.py,接入
validate_repo.py、skill_health.py、check_activation_cases.py、compare_skill_revisions.py。CI 安装pyyaml做确定性严格解析(requirements-dev.txt 实际内容为pyyaml与skills-ref两项)。解析器处理 LF/CRLF 行尾、UTF-8 BOM、带引号标量与折叠块标量,并拒绝空、过短或仅含指示符的 description——源码中可见MIN_DESCRIPTION_LENGTH = 20、YAML_INDICATOR_ONLY = ^[>|]?-?$与strip_bom/split_frontmatter等实现细节。 - 单元测试:researcher/scripts/tests/test_skill_frontmatter.py,覆盖解析器边界用例、未加引号冒号 bug 的严格 YAML 回归护栏、格式/解析往返、以及断言每个已发布技能都能干净解析的语料集成测试,在 CI 严格仓库门前执行。
- 示例技能同步:examples/digital-brain-skill/SKILL.md 与 examples/book-sft-pipeline/SKILL.md 的
description字段加引号——开发者会照抄这两个示例,同样的未加引号冒号 YAML 隐患必须修掉。 - 清单校验:
validate_repo.py --strict现在检查.plugin/plugin.json与.claude-plugin/marketplace.json命名同一个捆绑插件,且 Open Plugins 的skills发现解析到与仓库一致的 15 个已发布技能。 - 平台兼容性门:新增 researcher/scripts/validate_platform_compat.py,用上游
agentskillsCLI(来自skills-ref)校验已发布技能,检查 Open Plugins 与 Claude marketplace 发现一致性,并模拟.cursor/skills、.claude/skills、.codex/skills、.agents/skills的目录拷贝安装。 - 平台安装文档:README 改为记录 Cursor(
.cursor/skills/)、Claude Code(.claude/skills/)、Codex(.codex/skills/)的目录式安装路径,替代损坏的扁平单文件.md模式。当前 README.md 的 "Using Individual Skills" 一节即保留了这一结论:SKILL.md不得扁平化为.claude/skills/context-fundamentals.md单文件,否则会破坏相对references/路径并违反 Cursor、Claude Code、Codex 使用的 Agent Skills 目录规范。 - Open Plugins 发现:
.plugin/plugin.json声明"skills": "./skills/"。仓库不提交.agents/skills或.cursor/skills符号链接,因为符号链接在 Windows 与插件打包中脆弱。
v2.4.0:新技能 self-improvement-loops
第 16 个技能 skills/self-improvement-loops/SKILL.md,覆盖以 harness 本身为优化对象的系统:递归自我改进循环、meta-harness 搜索、失败驱动的有界自我编辑、进化脚手架搜索、上下文机制演化,以及自修改系统的验收门。锚定 Lilian Weng 的 "Harness Engineering for Self-Improvement"(Lil'Log,2026 年 7 月),每个承重的机制都与一手来源交叉验证(Self-Harness、Meta-Harness、MCE、ACE、Darwin Godel Machine、AlphaEvolve、ShinkaEvolve、STOP、ADAS、AFlow,以及 METR 与 Anthropic 的 reward-hacking/sandbagging 证据)。
- skills/self-improvement-loops/references/loop-design-evidence.md:带日期的逐系统数字、验收规则细节、消融发现、已记录的 reward-hacking 事件,按易变性策略(volatility policy)放在 references 而非技能正文。
- 显式边界:
harness-engineering拥有单个自主循环的控制面与治理;self-improvement-loops拥有"当控制面本身成为优化对象时"的情形。 - 语料接线:机制注册表新增 3 条(
two-split-no-regression-acceptance、filesystem-experience-archive、runtime-enforced-loop-constraints,合计 19 条);claims 新增 6 条一手来源溯源声明(合计 18 条);新增 2 个激活用例(合计 21 个)覆盖 self-improvement-loops vs harness-engineering 边界;新增 3 个路由基准 prompt(p051–p053),p036 更新为接受self-improvement-loops为次选;按基准策略,下一次付费路由 sweep 应发布 delta。 - 研究 run
20260708-034419-harness-engineering-for-self-improvement-lil-log跑完整状态机(来源评估加权 2.0 批准、新颖性检查、run 就绪)后以 accepted 关闭;运行时 run 工件按策略保持 gitignored。 - 清单升到 2.4.0,README、根 SKILL.md、CLAUDE.md、AGENTS.md 更新为 16 技能口径。
v2.5.0:新技能 long-horizon-prompting(当前版本)
第 17 个技能 skills/long-horizon-prompting/SKILL.md,覆盖长时间运行自主 agent 与并行多 agent 编排的启动 prompt。核心技术是伪形式化任务简报(pseudo-formal task brief):带退化情形(degenerate cases)的定义、精确成功谓词、枚举的不计数结果、带方法族注册表与 blocked-route 记账的编排策略、带枚举失效模式的对抗性审计、审计门控的返回条件、努力下限(effort floors)与污染护栏。锚定公开发布的 GPT-5.6 Sol Ultra Cycle Double Cover prompt(OpenAI,2026 年 7 月),每个要素都与厂商文档(OpenAI GPT-5 至 GPT-5.6 Sol 指南、multi-agent API;Anthropic 多 agent 研究系统、长时程 harness、Claude Fable 5 文档)及 2025–2026 研究交叉核对。技能正文中的 skills/long-horizon-prompting/SKILL.md 实际包含 10 行的简报解剖表(Definitions / Success predicate / Non-counting outcomes / Solvability framing / Orchestration policy / Verification policy / Reporting contract / Return condition / Effort floor / Contamination guards)及逐块"防什么失效"的说明。
- 四个参考文件:references/cdc-prompt-annotated.md(带溯源与诚实保留——未评审证明、无公开消融)、references/vendor-guidance.md(带日期的厂商指导摘录)、references/research-evidence.md(带日期的研究证据与要素-证据映射)、references/task-brief-template.md(可复用任务简报模板 + 10 维发布前评估 rubric)。
- 显式边界:
multi-agent-patterns拥有拓扑与协调机制;harness-engineering拥有运行时强制约束;evaluation/advanced-evaluation拥有评估器与 judge 构建。技能正文的Do not activate一节逐条列出了这些路由。 - 语料接线(当前仓库可验证):机制注册表新增 3 条——
pseudo-formal-task-specification、audit-gated-return-condition、independent-portfolio-approach-registry,researcher/mechanisms/registry.jsonl 现共 22 条,accepted-ledger 条目等待人工 PR 评审;researcher/claims/index.jsonl 新增 8 条溯源声明,现共 26 条;researcher/fixtures/activation-cases.jsonl 新增 2 个激活用例(共 23 个),覆盖 long-horizon-prompting vs multi-agent-patterns 边界;researcher/benchmarks/router/prompts.jsonl 新增 3 个路由 prompt(p054–p056,文件现共 56 条,p054/p055/p056 文本分别对应长时程自主 run、并行 swarm 根 prompt、"agent 过早返回半成品"三类场景)。 - 清单升到 2.5.0,README、根 SKILL.md、CLAUDE.md、AGENTS.md 更新为 17 技能口径。.claude-plugin/marketplace.json 的 skills 列表、README.md 的 "Skill Activation Scenarios" 表(
long-horizon-prompting与self-improvement-loops均带 NEW 标记)即此轮更新的落地结果。
可复现的验证门:如何核验这些变更
CHANGELOG 中大量结论来自确定性(无 API)门。结合 README.md 的 Operator commands 一节,在本地可按以下顺序核验任一发布版本的仓库一致性:
# 一次性安装验证依赖(requirements-dev.txt: pyyaml, skills-ref) python3 -m pip install -r requirements-dev.txt # 确定性门(CI 每次 PR 亦会运行) python3 -m unittest researcher.scripts.tests.test_skill_frontmatter python3 researcher/scripts/validate_platform_compat.py --require-reference-validator python3 researcher/scripts/validate_repo.py --strict python3 researcher/scripts/skill_health.py --strict --no-history python3 researcher/scripts/run_benchmarks.py python3 researcher/scripts/check_activation_cases.py # 逐 run 就绪性(仅活跃 run) python3 researcher/scripts/validate_run.py --run-dir researcher/runs/<run-id> # 连续循环(手动) python3 researcher/scripts/loop_discover.py python3 researcher/scripts/loop_step.py --allow-fetch python3 researcher/scripts/loop_daily.py python3 researcher/scripts/loop_status.py # 连续循环(macOS daemon) researcher/orchestration/launchd/install.sh # 安装 launchd 任务(10 分钟 step、12 小时 discover、每日运维) researcher/orchestration/launchd/uninstall.sh # 移除 launchd 任务其中validate_repo.py --strict将警告视为失败(源码中--strict参数即"warnings as failures");skill_health.py的严格模式会断言语料分达标且零标记技能。README 同时列出了该系统的四条保证:循环从不调用付费 LLM 或做出站写(HTTP 检索仅 stdlib、1.5 MB 上限、30 秒超时);机制晋升要求记录在案的人工评审者与通过的 run 就绪检查;所有队列变更原子且经fcntl锁串行化;agent 可在门通过后准备 PR,但合并与推送保持人工控制。付费路由基准则可通过 researcher/benchmarks/sdk-runner/ 的 runner 复现。
从 CHANGELOG 能读到的工程方法
这个 CHANGELOG 本身即是该仓库方法论的展示,对维护任何"技能/提示词语料库"的团队都有可迁移价值:
- 描述即路由信号,正文即激活后的行为:两者必须同步对齐,且分别用不同基准测量(阶段 2 只看描述,阶段 3 才加载正文)。2.3.0 的两轮 pass 正是这一拆分的实践。
- 数据驱动的修订:先跑基线 sweep,定位 top-1 最低的 2–3 个技能,做最小化描述重写,再复跑同 seed 同 fixture 的 sweep 出 delta 表;用激活回归用例(tripwire)保证后续变更不破坏已修复的边界。
- 诚实的负面结果:claude-opus-4-7 在 2.3.0 中的 -2.0pp、
advanced-evaluation的伪影回退、两条 0.00 的歧义 prompt,全部在 "Honest scope caveats" 中保留而非抹平。 - 把易变内容隔离:带日期的基准数字与系统参数放
references/与 claims 溯源文件(claim-*),技能正文只留稳定结构;validate_repo.py --strict强制这一边界。 - 运行时状态与语料严格分离:
researcher/runs/、队列、报告文件全部 gitignore,仅保留一个 worked-example 种子 run,使基准与语料可审计而不被运行时噪音污染。
以上条目均可在 CHANGELOG.md 对应版本小节中找到原文依据,配套实现在 researcher/scripts/、researcher/benchmarks/ 与 .github/workflows/validate.yml 中可逐一核对。
【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考