Anthropic 内部认为这是一个成熟 Skill 里最有价值的部分——记录模型在真实使用中踩过的坑。“扫描版 PDF 会静默返回空数组,要先检查页面类型”“这个命令在 macOS 正常但 Linux 会失败”。
前两天一个学员面完百度智能体平台组回来跟我说,面试官最后追了一个问题:“假设你现在要给 Agent 系统写一套 Skill,你会怎么保证这些 Skill 的质量?”
他说当时脑子里全是 Prompt 技巧,答完自己都觉得浅了。确实,这题的坑就在这儿——它表面问的是“怎么写”,实际考的是你能不能把 Skill 当成一个有生命周期的工程制品来对待,而不是一次性的提示词。
我们来看怎么把这题答出层次感。
首先你得让面试官知道你理解 Skill 在 Agent 系统里的定位。
Skill 不是一段随便写的 Prompt,它是 Agent 可以按需调用的、标准化的、可复用的能力模块。
你可以把它理解为 Agent 的“函数”——有明确的输入输出契约,有单一职责,有异常处理,能被不同的 Agent 在不同场景下反复调用。
这个定位一旦说清楚,面试官就知道你不是在聊 Prompt Engineering 的皮毛,而是在聊系统工程。
好,接下来我们进入核心:怎么写好一个 Skill。我把它归纳为五个关键维度:
1.第一个维度,叫“描述即选择信号”
这是很多人忽略的点。Agent 在运行时面对几十个 Skill,它怎么决定调用哪一个?靠的就是 Skill 的 description 字段。这个字段不是给人看的摘要,而是给模型看的触发条件。
Anthropic 内部的经验是,description 要写得“稍微 pushy 一点”,因为模型天然有 under-trigger 的倾向。
你不仅要写这个 Skill 做什么,还要写什么场景下必须触发它,甚至要加排除条件——“不要用于博客文章、邮件、长文写作”。
正向触发加反向排除,两者缺一不可。这就像你写一个 API 的路由匹配规则,匹配条件和排除条件都得精确。
2.第二个维度,叫“自由度梯度控制”
这是 Anthropic 官方最佳实践里反复强调的核心概念。不同任务对指令的约束程度应该不同。
开放性任务比如代码审查,多条路径都能走通,你给高自由度,用自然语言描述方向就行。中等自由度的场景比如部署流程,你给伪代码级别的步骤指引。
而高风险操作比如数据库迁移,你必须给精确的脚本,一个字都不能改。
很多人写 Skill 犯的错误是一刀切——要么全是 MUST/NEVER 的大写命令把模型锁死,要么全是模糊的“请酌情处理”。高质量 Skill 一定是根据每个步骤的脆弱程度来动态调节约束力度的。
3.第三个维度,叫“渐进式上下文加载”
Skill 和对话历史、系统提示词共享同一个上下文窗口,每一个 token 都是稀缺资源。
成熟的做法是把 SKILL.md 当作目录,核心内容控制在五百行以内,详细的 API 参考、示例、边界 case 放在子文件里,模型需要时再按需读取。
这就是 Progressive Disclosure——不要一次性把所有信息塞进去,而是建立一个浅层的引用图,让模型自己判断什么时候需要深入。Anthropic 工程师的原话是:如果你的 SKILL.md 超过三百行,就该拆了。
4.第四个维度,叫“解释 Why 而非堆砌 Rule”
这一点特别重要。写“MUST use constructor injection, NEVER use field injection”不如写“Use constructor injection. Field injection breaks testability because we cannot mock the field without Spring context.”
当你给了原因,模型就能泛化到你没预料到的边界情况。
纯规则只能覆盖你想到的场景,而带推理依据的指令能让模型在未知场景下做出合理判断。
当然,对于真正高危的操作步骤,裸命令式指令仍然是对的,这里的关键是区分“需要判断力的步骤”和“零容错的步骤”。
5.第五个维度,叫“可验证的工作流控制”
高质量 Skill 不是写完指令就完事了,它要内建质量闭环。具体来说有两个模式值得提:
一是 Self-Correcting Loop,生成输出后跑一个验证脚本,不通过就修正重来,直到通过为止,当然要设重试上限。
二是 Plan-Validate-Execute,对于批量或破坏性操作,先让模型生成一个 JSON 计划,用脚本验证计划的合法性,验证通过了再真正执行。
这两个模式的核心思想是一样的:把确定性的校验逻辑从模型的推理中剥离出来,交给代码去做。
6.最后补一个加分点:Skill 的 Gotchas Section
Anthropic 内部认为这是一个成熟 Skill 里最有价值的部分——记录模型在真实使用中踩过的坑。“扫描版 PDF 会静默返回空数组,要先检查页面类型”“这个命令在 macOS 正常但 Linux 会失败”。
这些都是迭代出来的经验,不是一次性能设计好的。所以高质量 Skill 一定是活的,它有版本管理,有持续的观察-修正-测试循环。
总结一下答题框架:先定位 Skill 是什么,再从描述字段的触发设计、自由度梯度控制、渐进式上下文管理、解释 Why 的指令风格、可验证的工作流闭环这五个维度展开,最后用 Gotchas 的持续迭代收尾。
这样答下来,既有架构视角又有工程细节,面试官会觉得你是真干过这事的人。
最后
我们整理出这套 AI 大模型 突围资料包:
✅ 从零到一的 AI 学习路径图
✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
✅ 百度/阿里专家闭门录播课
✅ 大模型当下最新行业报告
✅ 真实大厂面试真题
✅ 2025 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要 《 AI大模型 入门+进阶学习资源包》,下方扫码获取~
资料展示
下面是我整理的AI大模型学习资料和工具包预览,适合收藏后按主题逐步学习。
需要这份AI大模型资料清单的话,在评论区回复「清单」即可;我会根据大家的问题继续补充对应的实战内容。