하네스: {도메인명}
【免费下载链接】harnessA meta-skill that designs domain-specific agent teams, defines specialized agents, and generates the skills they use.项目地址: https://gitcode.com/GitHub_Trending/harness/harness
목표:{하네스의 핵심 목표 한 줄}
트리거:{도메인} 관련 작업 요청 시{orchestrator-skill-name}스킬을 사용하라. 단순 질문은 직접 응답 가능.
변경 이력:| 날짜 | 변경 내용 | 대상 | 사유 | |------|----------|------|------| | {YYYY-MM-DD} | 초기 구성 | 전체 | - |
**不要放进 CLAUDE.md 的内容**:Agent 列表、技能列表、目录结构、执行规则细节。原因:这些在编排器技能与 `.claude/agents/`、`.claude/skills/` 中已有单一事实来源,目录结构文件系统可直接查看。CLAUDE.md **只放指针(触发规则)+ 变更历史**。这正是 CHANGELOG v1.2.0 中"指针注册"策略的落地。 ### 7.6 后续任务支持(Phase 5-5) 编排器不只服务首次执行,还要承接后续请求,三件事必须做到: 1. **description 包含后续关键词**:只有初始关键词,后续请求不会触发。必须包含:"다시 실행(重新执行)""재실행""업데이트""수정""보완"、"{도메인}의 {부분작업}만 다시(只重做某部分)"、"이전 결과 기반으로(基于此前结果)""결과 개선(改进结果)"。 2. **编排器 Phase 1 加上下文检查**:开工先看既有产出存在性,据此分流: - `_workspace/` 存在 + 用户请求部分修改 → **部分重执行**(只重新调用相关 Agent); - `_workspace/` 存在 + 用户给了新输入 → **新执行**(把旧 `_workspace/` 移到 `_workspace_prev/`); - `_workspace/` 不存在 → **初始执行**。 3. **Agent 定义含重调用指引**:每个 Agent 的 `.md` 写"存在旧产出时的行为"——旧结果文件存在则读取并吸收改进点;用户给了反馈则只改相关部分。 ## 八、Phase 6:验证与测试 生成的 harness 必须经过验证。完整方法论见 [skill-testing-guide.md](https://link.gitcode.com/i/a2a80a154d40dbea749f68a41d88cbc8),核心循环是 **작성 → 테스트 실행 → 평가 → 개선 → 재테스트**(编写→测试→评估→改进→重测),评估 = 定性(用户审阅:文体/设计等主观质量)+ 定量(断言自动评分:文件生成/数据提取等客观可验证项)组合。 ### 8.1 结构验证(Phase 6-1) - 所有 Agent 文件位置正确; - 技能 frontmatter(name, description)合规; - Agent 间引用一致性; - **确认没有生成 `.claude/commands/`**(harness 只产出 agents/ 与 skills/,见产出清单)。 ### 8.2 按执行模式验证(Phase 6-2) - **Agent 团队**:成员间通信路径、任务依赖、团队规模是否合适; - **子 Agent**:各 Agent 输入输出连接、`run_in_background` 设置、返回值收集逻辑; - **混合**:每个 Phase 的执行模式是否在编排器中显式标注、Phase 边界数据传递是否断裂(团队→子切换时团队产出是否接入子的输入)。 ### 8.3 技能执行测试(Phase 6-3) 1. **写测试提示词**:每个技能 2~3 个贴近真实用户的、具体自然的句子。坏例 `"PDF를 처리하라"`;好例 `"다운로드 폴더에 있는 'Q4_매출_최종_v2.xlsx'에서 C열(매출)과 D열(비용)을 사용해서 이익률(%) 열을 추가해줘"`。要混合正式/随意、显式/隐式、简单/复杂,可含缩写、错别字。 2. **With-skill vs Without-skill 对照**:尽量并行跑两个,验证技能附加值。每次**同时**派生两个 Agent: - **With-skill**:读技能后执行; - **Without-skill(baseline)**:同提示词不带技能执行。 基线选择:新技能 → 不带技能跑同提示词;改既有技能 → 用修改前版本快照。子 Agent 完成通知里的 `total_tokens` 与 `duration_ms` **必须当场存盘**——该数据只在通知时点可访问,之后无法恢复。 3. **结果评估**:客观可验证产出(文件生成、数据提取)定义断言;主观产出(文体、设计)依赖用户反馈。**警惕非区分性断言**——"两种配置都 100% 通过"的断言测不出技能价值,应删除或换成更有挑战性的断言。评分数据结构(`grading.json`)字段必须用 `text`/`passed`/`evidence`,见 [skill-writing-guide.md](https://link.gitcode.com/i/e489af53e6cd6f8561d8b5fa2ea716bd)。 4. **迭代改进循环**:发现问题就**泛化**修改技能(禁止只适配特定例子的窄修复)→ 重测 → 直到用户满意或无实质改进。 5. **重复模式捆绑**:测试中发现 Agent 们反复手写相同代码(如每次测试都生成同一 helper 脚本),就预捆绑进 `scripts/`。 测试工作区结构(来自 [skill-testing-guide.md](https://link.gitcode.com/i/a2a80a154d40dbea749f68a41d88cbc8#8-工作区结构)):`{skill-name}-workspace/iteration-N/eval-{descriptive-name}/with_skill|without_skill/{outputs,timing.json,grading.json}`,eval 目录用描述性名称、每轮迭代独立目录不覆盖、`_workspace/` 不删除(审计追踪)。可选高级功能是"专业评估 Agent"——Grader(断言评分+事实声明交叉验证)、Comparator(匿名 A/B 盲评两个产出)、Analyzer(分析非区分性断言、高方差 eval、时间/令牌权衡)。description 自动优化则用 20 条查询 Train/Test 6:4 切分、Test 集选优、最多 5 轮,成本高故放在技能稳定后的最终阶段。 ### 8.4 触发验证(Phase 6-4) - **Should-trigger 查询(8~10 个)**:应触发技能的各种表达(正式/随意、显式/隐式); - **Should-NOT-trigger 查询(8~10 个)**:关键词相近但该用其他工具/技能的 **near-miss** 查询。 near-miss 写作关键:"写个斐波那契函数"这种明显无关的查询没有测试价值;**"把这个 Excel 的图表导出成 PNG"(xlsx 技能 vs 图片转换)这类边界模糊的查询才是好用例**。同时检查新技能 description 与既有技能触发区是否冲突(收集既有技能 description,确认新技能的 should-trigger 查询不会误触发旧技能,冲突则细化边界条件)。 ### 8.5 空跑测试(Phase 6-5) - 编排器 Phase 顺序逻辑是否合理; - 数据传递路径有无空段(dead link); - 所有 Agent 输入是否匹配上一 Phase 输出; - 各错误场景的兜底路径是否可执行。 ### 8.6 测试场景编写(Phase 6-6) 编排器技能中加 `## 테스트 시나리오` 章节,至少写**1 个正常流 + 1 个错误流**(正常流:输入→各 Phase→最终产出生成;错误流:某成员中途失败→领导收到空闲通知→SendMessage 确认→重启或重分配→以剩余结果继续→报告中注明缺失,模板见 [orchestrator-template.md](https://link.gitcode.com/i/dddb9b490d52d42e18deec22e3197fd4))。 ## 九、Phase 7:Harness 的持续演进与运维 harness 不是一次成型就结束的静态产物,而是随用户反馈持续进化的系统。 ### 9.1 执行后收集反馈(Phase 7-1) 每次 harness 执行完,向用户询问:"结果有要改进的地方吗?""团队构成或工作流有想改的吗?"——没有反馈就跳过,不强迫但必须给机会。 ### 9.2 反馈落点(Phase 7-2) | 反馈类型 | 修改对象 | 示例 | |----------|----------|------| | 产出质量 | 对应 Agent 的技能 | "分析太表面" → 技能加深度标准 | | Agent 角色 | Agent 定义 `.md` | "需要安全审查" → 新增 Agent | | 工作流顺序 | 编排器技能 | "应该先验证" → 调整 Phase 顺序 | | 团队构成 | 编排器 + Agent | "这俩可以合并" → 合并 Agent | | 触发缺失 | 技能 description | "这样说没触发" → 扩展 description | ### 9.3 变更历史(Phase 7-3) 所有变更记入 CLAUDE.md 的**变更历史**表(与 Phase 5-4 模板同一张表): ```markdown **변경 이력:** | 날짜 | 변경 내용 | 대상 | 사유 | |------|----------|------|------| | 2026-04-05 | 초기 구성 | 전체 | - | | 2026-04-07 | QA 에이전트 추가 | agents/qa.md | 산출물 품질 검증 부족 피드백 | | 2026-04-10 | 톤 가이드 추가 | skills/content-creator | "너무 딱딱하다" 피드백 |【免费下载链接】harnessA meta-skill that designs domain-specific agent teams, defines specialized agents, and generates the skills they use.项目地址: https://gitcode.com/GitHub_Trending/harness/harness
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考