Agent Skills for Context Engineering 版本演进全记录:从 13 技能基线到 2.5.0 的可测量路由基准体系
2026/9/13 4:54:58 网站建设 项目流程

Agent Skills for Context Engineering 版本演进全记录:从 13 技能基线到 2.5.0 的可测量路由基准体系

【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering

本文为技术型作者基于当前仓库的 CHANGELOG.md 所写,完整覆盖该仓库从 2.0.0 基线语料到 2.5.0 的七个版本变更:研究操作系统(mechanism registry、run 状态机、连续循环)、首个端到端执行的路由基准测试(600 次运行 × 4 个前沿模型)、跨平台 YAML frontmatter 修复,以及self-improvement-loopslong-horizon-prompting两个新技能的落地与语料接线。读完后,你将掌握该项目"先写描述、再用数据证明路由正确"的工程闭环,以及如何在自己的技能库中复用其确定性验证门、描述重写与边界回归测试方法。

版本总览:语义化版本 + "技能内容即数据"

CHANGELOG 开篇声明了本仓库的版本策略:所有显著变更在此记录,版本在可行范围内遵循语义化版本(semantic versioning),技能内容(skill content)被视为数据而非库代码——这解释了为何新增技能是 Minor 版本(2.3.0 → 2.4.0 → 2.5.0 各对应一个第 15/16/17 个技能),而修复类变更走 Patch(2.3.0 → 2.3.1)。

完整时间线如下:

版本日期主题
2.0.0早期13 个技能的基线语料,以单一 Claude Code 插件分发
2.1.02026-05-14新增harness-engineering技能;researcher/目录 v1
2.2.02026-05-15研究操作系统(机制注册表、run 状态机、连续循环、CI 门)
2.3.02026-05-15首个带实测基准结果版本:路由基准端到端执行 + 描述重写
2.3.12026-06-29跨平台 YAML frontmatter 修复与平台兼容性门
2.4.02026-07-08新增self-improvement-loops技能(第 16 个)
2.5.02026-07-11新增long-horizon-prompting技能(第 17 个)

该时间线与当前仓库实际状态完全吻合:两份插件清单 .plugin/plugin.json 与 .claude-plugin/marketplace.json 的version字段均为2.5.0,marketplace 清单声明的 17 个技能路径与 README.md 的技能总表一致;根目录 SKILL.md 同样更新为 17 技能口径。

v2.1.0 与 v2.2.0:研究操作系统落地

新增 harness-engineering 技能与 researcher/ v1(2.1.0)

  • harness-engineering技能:锁定/可编辑表面模型(locked/editable surface model)、持久线程(durable threads)、新颖性门(novelty gates)、回滚、人工审批边界;对应 skills/harness-engineering/SKILL.md。
  • researcher/目录 v1:来源注册表 researcher/source-registry.md、内容与技能/harness 评分细则(researcher/rubrics/)、来源评估 JSON 模板 researcher/templates/source-evaluation.json、技能提案模板 researcher/templates/skill-proposal.md、自主研究循环 runbook 与 PR 就绪 runbook(researcher/runbooks/)。

研究操作系统(2.2.0 Added)

v2.2.0 是本仓库的分水岭:researcher/从一个目录演进为一套基于文件的操作系统,目标是让仓库成为"复利式的事实来源"而非技能文集。CHANGELOG 列出的组件在仓库中均可定位:

  • 机制注册表researcher/mechanisms/registry.jsonl:种子版本含 5 个已接受机制(locked-editable-surfacesdurable-research-threaddeterministic-first-validationstructured-novelty-gatepairwise-skill-revision)。每条记录含mechanism_idowning_skillstatusactivation_scenariobehavior_changeevidencefailure_modes字段——注册表用"机器可读的行为模式"作为新颖性判断的主信号。
  • 机制账本researcher/mechanisms/ledgers/accepted.jsonl 与 researcher/mechanisms/ledgers/rejected.jsonl:append-only 的晋升事件,作为制度记忆。
  • 声明溯源researcher/claims/index.jsonl:为evaluationmulti-agent-patternscontext-optimizationmemory-systemsadvanced-evaluationharness-engineering中 6 条易变或基准背书的声明建立来源 URL、证据强度、易变性与复审日期记录。
  • 语料索引researcher/corpus/index.json:技能 → 激活场景 → 机制 ID → 声明 ID 的规范机器可读映射。
  • 激活回归夹具researcher/fixtures/activation-cases.jsonl:覆盖高风险技能边界对的确定性 prompt。
  • 对抗性基准researcher/benchmarks/scenarios/adversarial.jsonl + 金标 researcher/benchmarks/goldens/adversarial-goldens.json:7 个试图"钻循环空子"的场景(重复机制、未检索证据、错误评分算术、自批评分修改、弱证据新颖性)。
  • 基准历史researcher/reports/benchmark-history.jsonl:纵向趋势跟踪。
  • 成对修订细则与脚本:researcher/rubrics/pairwise-skill-revision.md 与 researcher/scripts/compare_skill_revisions.py。
  • Run 状态机run-state.json显式迁移链initialized -> retrieved -> evaluated -> proposed -> novelty_checked -> validated -> pr_ready -> closed。仓库保留了种子 run researcher/runs/20260515-035228-executable-autonomous-research-frameworks/ 作为 worked-example 夹具,其 run-state.json 实际包含current_stateclose_statuslocked_surfaceseditable_surfacesstate_history等字段,印证了状态机设计。

连续循环(2.2.0 Continuous loop)

  • 队列基础设施researcher/queue/:inbox、parked、done、quarantine 四类。
  • 编排配置researcher/orchestration/config.json:daily/active/parked/failure 四类预算。
  • 发现喂入器researcher/scripts/loop_discover.py:从 researcher/discovery/manual-seed.jsonl 读取。
  • 循环步进编排器researcher/scripts/loop_step.py:收割已关闭 run、从 inbox 拉取、用 stdliburllib检索、在人工评审门处 park。
  • 每日运维researcher/scripts/loop_daily.py:跑校验器、基准、激活用例并写出带日期快照。
  • 状态面板researcher/scripts/loop_status.py 与 parked 评审面。
  • launchd 服务定义researcher/orchestration/launchd/:install/uninstall 脚本与逐脚本包装器。
  • 连续运维 runbookresearcher/runbooks/continuous-operation.md。

脚本与 CI(2.2.0)

  • researcher/scripts/validate_run.py:逐 run 发布就绪性检查,跳过已关闭 run。
  • researcher/scripts/research_loop.py 子命令:retrieveevaluateproposenoveltyvalidate-runpr-readyclosepromote-mechanisms
  • researcher/scripts/check_activation_cases.py:确定性激活回归检查器。
  • researcher/scripts/run_benchmarks.py:跑确定性门与场景,可选记录历史。
  • researcher/scripts/loop_common.py:共享原子写辅助与fcntl锁。
  • CI 工作流 .github/workflows/validate.yml 在每次 push 与 PR 上运行validate_repo.py --strictrun_benchmarks.pycheck_activation_cases.py及 Python 编译检查。当前工作流实际以 Python 3.12 运行,先pip install -r requirements-dev.txt,再对全部 researcher 脚本执行py_compile,随后运行 frontmatter 单元测试。

变更、加固与仓库策略(2.2.0)

  • 变更:技能激活面从"关键词触发"重构为 frontmatter 与 README 中的任务边界式描述(task-boundary descriptions),影响全部 14 个已发布技能及 examples/ 示例技能。validate_repo.py加固项:重复 JSON 键、文档精确同步、评分细则 ID、run 工件、注册表 schema、证据路径、部分检索批准、根级 raw 溯源、claims schema、语料索引一致性、激活用例、基准场景。researcher/scripts/novelty_check.py 改为以机制注册表重叠为主信号、语料重叠为次信号;机制注册表的 evidence 现在可以引用researcher/claims/index.jsonl中的 claim ID。
  • 加固:所有队列变更使用临时文件 +os.replace原子写,并按队列族加fcntl排他锁;read_jsonl容错——坏行隔离到researcher/reports/jsonl-quarantine/而不是崩溃循环;fetch_url仅允许http(s)://且在重定向后二次检查 scheme;已关闭 run 自动从parked.jsonl收割并记入done.jsonl;inbox 锁在init_run期间保持,防止并发loop_step超预算;URL 去重在哈希前做大小写归一。
  • 仓库策略researcher/runs/*/下的活跃研究 run 是运行时状态、不提交;种子 run20260515-035228-executable-autonomous-research-frameworks保留为 worked-example 夹具。运行时队列与报告文件(researcher/queue/*.jsonlresearcher/reports/下的 logs、snapshots、loop-events、loop-failures、status.md、parked-review.md,以及researcher/queue/.locks/)均被 gitignore。
  • 2.2.0 明确不做的事:LLM-judge 适配器(自动推进retrieved -> evaluated);手动种子文件之外的自动来源发现(Parallel deep research 与 web search 适配器只是配置开关后的占位);日志轮转与基准历史修剪。

v2.3.0:从"写了描述"到"证明路由正确"

CHANGELOG 对 2.3.0 的定位非常明确:首个带实测基准结果、跨四个前沿模型发布的路由基准版本,把闭环从"我们写了技能描述"推进到"我们证明了它们能正确路由"。

阶段 2 路由基准:端到端执行

  • 600/600 运行完成:4 个模型(composer-2claude-opus-4-7gpt-5.5gemini-3.1-pro)× 50 个 prompt × 3 次复现。初始 v2.2.0 基线在 researcher/benchmarks/router/results-published/2026-05-15.md(566/600,v1 runner 中途死掉);描述修复后的更新运行在 researcher/benchmarks/router/results-published/2026-05-15-v2.md,含完整 delta-vs-baseline 表。
  • 50 个真值路由 prompt位于 researcher/benchmarks/router/prompts.jsonl,覆盖阳性对照、对抗性边界对、组合技能 prompt 与阴性对照。
  • researcher/scripts/render_router_report.py 带--baseline参数出 delta 报告——当前源码中确有baseline_summarybaseline_confusionbaseline_label等参数与 "## Delta vs baseline" 输出段。
  • researcher/benchmarks/router/results-published/README.md 解释"提交摘要 vs gitignore 原始数据"的拆分策略。

加固后的 SDK runner(researcher/benchmarks/sdk-runner/src/)

针对 v1 sweep 静默卡在 566/600 无信号的问题,researcher/benchmarks/sdk-runner/src/ 做了四项加固:

  • Resume:启动时扫描目标目录,跳过已有 per-run JSON 的计划项;被杀掉的 sweep 可精确续跑,不浪费额度、不重复运行。
  • 有界并发--concurrency N同时跑 N 个 agent 调用。600-run sweep 从顺序的约 60 分钟降到并发 4 的约 15 分钟,正确性不变。
  • 逐 run 进度日志:每个完成的 run 打印[N/total] model prompt rep=R status durationMs T1 ETA=duration
  • 格式失败重试:瞬时空响应或不可解析响应在记为格式失败前先重试一次(5 月 19 日 sweep 曾产生瞬时空白输出、重跑即成功,由此加入)。
  • common.ts中的runConcurrently辅助函数可被未来 runner 复用。源码层面,common.ts 确实实现了带concurrency/noResume标志的 CLI 解析与有界并发执行器,runRouter.ts 在concurrency: 1默认值下调用runConcurrently(remaining, ...)

数据驱动的技能描述重写

v2.2.0 基线基准暴露了两个路由失败点,针对性重写后:

技能重写策略Top-1 变化
context-fundamentals改为明确讲概念基础,把操作性工作显式路由到专门技能0.255 → 0.489(+23.4pp)
project-development收紧并加对tool-design的显式交叉引用0.750 → 1.000(达到完美路由)
tool-design收紧并加对project-development的显式交叉引用0.729 → 0.807(+7.8pp)

技能正文与新描述的对齐

关键前提:路由基准只能看到 frontmatter 的description,因为 runner 使用settingSources: []排除了 SKILL.md 正文。第一次描述重写留下了正文(When to ActivatePractical GuidanceIntegration)仍宣称重写前更大范围的问题——一旦技能在生产中真正激活,正文会把 agent 引向操作型工作。于是做了第二轮正文对齐:

  • skills/context-fundamentals/SKILL.md:When to Activate改写为概念触发器 + 显式 do-not-activate 路由;删除操作性小节(文件访问归filesystem-context,上下文预算归context-optimization);Integration改写为覆盖全部 14 个兄弟技能的路由图。内部版本 2.0.0 → 2.1.0。
  • skills/tool-design/SKILL.md:锚定工作单元(单个工具或工具目录),列出project-developmentmulti-agent-patternscontext-optimization拥有的相邻决策。内部版本 2.0.0 → 2.1.0。
  • skills/project-development/SKILL.md:锚定项目形态与流水线,列出tool-designcontext-optimizationmulti-agent-patternsharness-engineering拥有的相邻决策。内部版本 1.1.0 → 1.2.0。

CHANGELOG 特别点明:正文变更不影响路由基准数字(路由只看描述),但影响技能激活后 agent 实际加载的内容;测量这种对齐效果的合适位置是阶段 3(加载完整正文的有效性基准)。

全语料技能强化

三个技能针对性对齐之后,全部 15 个已发布技能按同一标准审计:显式所有权边界、Do not activate路由、可执行实操指导、示例、坑、集成边界、机制覆盖、声明溯源、激活夹具。结果:

  • 15 个技能正文全部按范围更新,含bdi-mental-stateshosted-agents的结构修复、旧技能更强的负向路由、上下文失效模式的更清晰示例、易变基准声明的 claim 背书措辞。
  • researcher/mechanisms/registry.jsonl 从 5 扩到 16 个已接受机制,使每个已发布技能至少拥有一个机器可读行为模式。
  • 声明溯源从 6 条扩到 12 条,把模糊的 run 摘要来源替换为具体仓库路径(BrowseComp、RULER/lost-in-middle、压缩、d0、Latent Briefing、memory、tool-output 声明)。
  • 激活回归覆盖从 14 扩到 19 个用例,bdi-mental-statescontext-degradationhosted-agentslatent-briefingmulti-agent-patterns等全部有确定性路由覆盖。
  • validate_repo.py --strict收紧:Core ConceptsPractical GuidanceExamplesReferences与显式非激活边界从可选变为强制。
  • template/SKILL.md 更新为新的全语料标准:正文/frontmatter 对齐、机制注册、可执行指导、易变声明的claim-*溯源。当前模板的 description 与正文中"每个技能正文必须显式声明所有权边界"的要求即源于此轮。
  • 无 API 门全部复跑:validate_repo.py --strict0 错 0 警;researcher/scripts/skill_health.py--strict --no-history语料分从 0.8111/2 个标记技能提升到 0.9117/0 标记;check_activation_cases.py19/19 通过;run_benchmarks.py3 项检查 + 7 个对抗场景通过。
  • 复跑付费阶段 2 基准:600/600 可用记录、0 格式失败,发布为 researcher/benchmarks/router/results-published/2026-05-19.md。该报告头部记录 commit、fixture sha256-16(8f974d930836bc9c)、seed=1、600 次运行与 3 复现,方法学为"15 个技能描述按确定性打乱序注入 prompt,模型返回排序 JSON,top-1/top-3 对expected_primary_skill评分,95% bootstrap 置信区间"。

11 个新边界回归用例

researcher/fixtures/activation-cases.jsonl 从 8 个用例扩到 19 个。前 6 个新用例针对 v2.2.0 基线观察到的具体混淆:activation-fundamentals-vs-degradationactivation-fundamentals-onboardingactivation-fundamentals-vs-optimizationactivation-tool-vs-project-structured-outputactivation-tool-individual-toolactivation-tool-consolidation。全语料 pass 再补 5 个此前未覆盖技能的用例:activation-bdi-vs-memoryactivation-degradation-poisoningactivation-hosted-vs-harnessactivation-latent-briefing-vs-memoryactivation-multi-agent-topology。这些用例充当绊线(tripwire):任何未来描述变更都要对它们负责。

阶段 1 技能健康(无 API 成本)

researcher/scripts/skill_health.py:逐技能结构评分。脚本头注释自述其设计约束——确定性、不调用任何 LLM、默认不发 HTTP(--check-urls才发),输出写入 gitignore 的researcher/reports/skill-health.json并可选追加skill-health-history.jsonl。基线:语料分 0.8111、15 个技能中 2 个被标记(bdi-mental-states缺必需章节、hosted-agents多项结构问题);强化 pass 后 0.9117、0 标记。

2.3.0 实测结果与诚实的范围保留

按模型 top-1 准确率(基线 → 新描述,600-run sweep,seed=1,fixture sha 8f974d9):

模型基线新描述Delta
composer-20.8880.913+2.5pp
gpt-5.50.8860.913+2.7pp
gemini-3.1-pro0.8860.925+3.9pp
claude-opus-4-70.8860.867-2.0pp

全语料强化 pass 之后(2026-05-19 发布报告)按模型 top-1:Gemini 0.920、Composer 0.913、GPT-5.5 0.913、Claude Opus 4.7 0.840,剩余失败集中在已知歧义/阴性对照 prompt(p046p048)与context-fundamentals兜底边界。格式合规率 99.5%(3 次失败,全部 Gemini);延迟:Gemini 中位数约 9.1s,其他 3.3–4.2s;总 sweep 成本约 7.20 USD,低于 15 USD 预算上限。

CHANGELOG 的 "Honest scope caveats" 一节值得逐条继承:

  • context-fundamentals进步大但仍是最弱技能(top-1 0.489),剩余失败把通用 onboarding prompt 路由到了project-development;再来一轮描述 pass 可能推过 0.75。
  • 两个 prompt 在所有模型上都保持 0.00:p046(Python 重排,阴性对照)与 p048(评估 KV 压缩,真正歧义),应重新打标或移出阳性路由测试。
  • advanced-evaluation表面回退 -18.3pp,但主要是 v2.2.0 基线在 runner 死于 566/600 时缺了 11 次尝试的伪影;绝对正确数 48 基线 → 47 新。
  • 阶段 3(带/不带技能加载的真实 agent 任务)仍只是脚手架未执行,是下一步投入。
  • run 状态机没有 LLM-judge 适配器;除手动种子外没有自动来源发现。

变更项:版本在 .claude-plugin/marketplace.json、.plugin/plugin.json、根 SKILL.md 从 2.2.0 升到 2.3.0;researcher/benchmarks/PLAN.md 状态表反映阶段 0/1/2 已交付、阶段 3/4 仍为脚手架。

v2.3.1:跨平台 YAML frontmatter 修复

这是一个典型的"文档即接口"问题版本:15 个已发布技能中 11 个的description值未加引号且含冒号,被严格 YAML 解析器(Cursor、Claude Code、Codex、Agent Skills 校验器)拒绝。修复内容:

  • YAML 安全引号:全部技能描述改为 YAML 安全引用;memory-systems不再使用被仓库校验器误读为">"的折叠块标量。
  • 共享 frontmatter 解析器:新增 researcher/scripts/skill_frontmatter.py,接入validate_repo.pyskill_health.pycheck_activation_cases.pycompare_skill_revisions.py。CI 安装pyyaml做确定性严格解析(requirements-dev.txt 实际内容为pyyamlskills-ref两项)。解析器处理 LF/CRLF 行尾、UTF-8 BOM、带引号标量与折叠块标量,并拒绝空、过短或仅含指示符的 description——源码中可见MIN_DESCRIPTION_LENGTH = 20YAML_INDICATOR_ONLY = ^[>|]?-?$strip_bom/split_frontmatter等实现细节。
  • 单元测试:researcher/scripts/tests/test_skill_frontmatter.py,覆盖解析器边界用例、未加引号冒号 bug 的严格 YAML 回归护栏、格式/解析往返、以及断言每个已发布技能都能干净解析的语料集成测试,在 CI 严格仓库门前执行。
  • 示例技能同步:examples/digital-brain-skill/SKILL.md 与 examples/book-sft-pipeline/SKILL.md 的description字段加引号——开发者会照抄这两个示例,同样的未加引号冒号 YAML 隐患必须修掉。
  • 清单校验validate_repo.py --strict现在检查.plugin/plugin.json.claude-plugin/marketplace.json命名同一个捆绑插件,且 Open Plugins 的skills发现解析到与仓库一致的 15 个已发布技能。
  • 平台兼容性门:新增 researcher/scripts/validate_platform_compat.py,用上游agentskillsCLI(来自skills-ref)校验已发布技能,检查 Open Plugins 与 Claude marketplace 发现一致性,并模拟.cursor/skills.claude/skills.codex/skills.agents/skills的目录拷贝安装。
  • 平台安装文档:README 改为记录 Cursor(.cursor/skills/)、Claude Code(.claude/skills/)、Codex(.codex/skills/)的目录式安装路径,替代损坏的扁平单文件.md模式。当前 README.md 的 "Using Individual Skills" 一节即保留了这一结论:SKILL.md不得扁平化为.claude/skills/context-fundamentals.md单文件,否则会破坏相对references/路径并违反 Cursor、Claude Code、Codex 使用的 Agent Skills 目录规范。
  • Open Plugins 发现.plugin/plugin.json声明"skills": "./skills/"。仓库不提交.agents/skills.cursor/skills符号链接,因为符号链接在 Windows 与插件打包中脆弱。

v2.4.0:新技能 self-improvement-loops

第 16 个技能 skills/self-improvement-loops/SKILL.md,覆盖以 harness 本身为优化对象的系统:递归自我改进循环、meta-harness 搜索、失败驱动的有界自我编辑、进化脚手架搜索、上下文机制演化,以及自修改系统的验收门。锚定 Lilian Weng 的 "Harness Engineering for Self-Improvement"(Lil'Log,2026 年 7 月),每个承重的机制都与一手来源交叉验证(Self-Harness、Meta-Harness、MCE、ACE、Darwin Godel Machine、AlphaEvolve、ShinkaEvolve、STOP、ADAS、AFlow,以及 METR 与 Anthropic 的 reward-hacking/sandbagging 证据)。

  • skills/self-improvement-loops/references/loop-design-evidence.md:带日期的逐系统数字、验收规则细节、消融发现、已记录的 reward-hacking 事件,按易变性策略(volatility policy)放在 references 而非技能正文。
  • 显式边界harness-engineering拥有单个自主循环的控制面与治理;self-improvement-loops拥有"当控制面本身成为优化对象时"的情形。
  • 语料接线:机制注册表新增 3 条(two-split-no-regression-acceptancefilesystem-experience-archiveruntime-enforced-loop-constraints,合计 19 条);claims 新增 6 条一手来源溯源声明(合计 18 条);新增 2 个激活用例(合计 21 个)覆盖 self-improvement-loops vs harness-engineering 边界;新增 3 个路由基准 prompt(p051–p053),p036 更新为接受self-improvement-loops为次选;按基准策略,下一次付费路由 sweep 应发布 delta。
  • 研究 run20260708-034419-harness-engineering-for-self-improvement-lil-log跑完整状态机(来源评估加权 2.0 批准、新颖性检查、run 就绪)后以 accepted 关闭;运行时 run 工件按策略保持 gitignored。
  • 清单升到 2.4.0,README、根 SKILL.md、CLAUDE.md、AGENTS.md 更新为 16 技能口径。

v2.5.0:新技能 long-horizon-prompting(当前版本)

第 17 个技能 skills/long-horizon-prompting/SKILL.md,覆盖长时间运行自主 agent 与并行多 agent 编排的启动 prompt。核心技术是伪形式化任务简报(pseudo-formal task brief):带退化情形(degenerate cases)的定义、精确成功谓词、枚举的不计数结果、带方法族注册表与 blocked-route 记账的编排策略、带枚举失效模式的对抗性审计、审计门控的返回条件、努力下限(effort floors)与污染护栏。锚定公开发布的 GPT-5.6 Sol Ultra Cycle Double Cover prompt(OpenAI,2026 年 7 月),每个要素都与厂商文档(OpenAI GPT-5 至 GPT-5.6 Sol 指南、multi-agent API;Anthropic 多 agent 研究系统、长时程 harness、Claude Fable 5 文档)及 2025–2026 研究交叉核对。技能正文中的 skills/long-horizon-prompting/SKILL.md 实际包含 10 行的简报解剖表(Definitions / Success predicate / Non-counting outcomes / Solvability framing / Orchestration policy / Verification policy / Reporting contract / Return condition / Effort floor / Contamination guards)及逐块"防什么失效"的说明。

  • 四个参考文件:references/cdc-prompt-annotated.md(带溯源与诚实保留——未评审证明、无公开消融)、references/vendor-guidance.md(带日期的厂商指导摘录)、references/research-evidence.md(带日期的研究证据与要素-证据映射)、references/task-brief-template.md(可复用任务简报模板 + 10 维发布前评估 rubric)。
  • 显式边界multi-agent-patterns拥有拓扑与协调机制;harness-engineering拥有运行时强制约束;evaluation/advanced-evaluation拥有评估器与 judge 构建。技能正文的Do not activate一节逐条列出了这些路由。
  • 语料接线(当前仓库可验证):机制注册表新增 3 条——pseudo-formal-task-specificationaudit-gated-return-conditionindependent-portfolio-approach-registry,researcher/mechanisms/registry.jsonl 现共 22 条,accepted-ledger 条目等待人工 PR 评审;researcher/claims/index.jsonl 新增 8 条溯源声明,现共 26 条;researcher/fixtures/activation-cases.jsonl 新增 2 个激活用例(共 23 个),覆盖 long-horizon-prompting vs multi-agent-patterns 边界;researcher/benchmarks/router/prompts.jsonl 新增 3 个路由 prompt(p054–p056,文件现共 56 条,p054/p055/p056 文本分别对应长时程自主 run、并行 swarm 根 prompt、"agent 过早返回半成品"三类场景)。
  • 清单升到 2.5.0,README、根 SKILL.md、CLAUDE.md、AGENTS.md 更新为 17 技能口径。.claude-plugin/marketplace.json 的 skills 列表、README.md 的 "Skill Activation Scenarios" 表(long-horizon-promptingself-improvement-loops均带 NEW 标记)即此轮更新的落地结果。

可复现的验证门:如何核验这些变更

CHANGELOG 中大量结论来自确定性(无 API)门。结合 README.md 的 Operator commands 一节,在本地可按以下顺序核验任一发布版本的仓库一致性:

# 一次性安装验证依赖(requirements-dev.txt: pyyaml, skills-ref) python3 -m pip install -r requirements-dev.txt # 确定性门(CI 每次 PR 亦会运行) python3 -m unittest researcher.scripts.tests.test_skill_frontmatter python3 researcher/scripts/validate_platform_compat.py --require-reference-validator python3 researcher/scripts/validate_repo.py --strict python3 researcher/scripts/skill_health.py --strict --no-history python3 researcher/scripts/run_benchmarks.py python3 researcher/scripts/check_activation_cases.py # 逐 run 就绪性(仅活跃 run) python3 researcher/scripts/validate_run.py --run-dir researcher/runs/<run-id> # 连续循环(手动) python3 researcher/scripts/loop_discover.py python3 researcher/scripts/loop_step.py --allow-fetch python3 researcher/scripts/loop_daily.py python3 researcher/scripts/loop_status.py # 连续循环(macOS daemon) researcher/orchestration/launchd/install.sh # 安装 launchd 任务(10 分钟 step、12 小时 discover、每日运维) researcher/orchestration/launchd/uninstall.sh # 移除 launchd 任务

其中validate_repo.py --strict将警告视为失败(源码中--strict参数即"warnings as failures");skill_health.py的严格模式会断言语料分达标且零标记技能。README 同时列出了该系统的四条保证:循环从不调用付费 LLM 或做出站写(HTTP 检索仅 stdlib、1.5 MB 上限、30 秒超时);机制晋升要求记录在案的人工评审者与通过的 run 就绪检查;所有队列变更原子且经fcntl锁串行化;agent 可在门通过后准备 PR,但合并与推送保持人工控制。付费路由基准则可通过 researcher/benchmarks/sdk-runner/ 的 runner 复现。

从 CHANGELOG 能读到的工程方法

这个 CHANGELOG 本身即是该仓库方法论的展示,对维护任何"技能/提示词语料库"的团队都有可迁移价值:

  1. 描述即路由信号,正文即激活后的行为:两者必须同步对齐,且分别用不同基准测量(阶段 2 只看描述,阶段 3 才加载正文)。2.3.0 的两轮 pass 正是这一拆分的实践。
  2. 数据驱动的修订:先跑基线 sweep,定位 top-1 最低的 2–3 个技能,做最小化描述重写,再复跑同 seed 同 fixture 的 sweep 出 delta 表;用激活回归用例(tripwire)保证后续变更不破坏已修复的边界。
  3. 诚实的负面结果:claude-opus-4-7 在 2.3.0 中的 -2.0pp、advanced-evaluation的伪影回退、两条 0.00 的歧义 prompt,全部在 "Honest scope caveats" 中保留而非抹平。
  4. 把易变内容隔离:带日期的基准数字与系统参数放references/与 claims 溯源文件(claim-*),技能正文只留稳定结构;validate_repo.py --strict强制这一边界。
  5. 运行时状态与语料严格分离researcher/runs/、队列、报告文件全部 gitignore,仅保留一个 worked-example 种子 run,使基准与语料可审计而不被运行时噪音污染。

以上条目均可在 CHANGELOG.md 对应版本小节中找到原文依据,配套实现在 researcher/scripts/、researcher/benchmarks/ 与 .github/workflows/validate.yml 中可逐一核对。

【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询