☰
选择TypeSafe三大AI决策原语:TypeSafe Agent Skills中Choice、Noul与Score完全指南
2026/10/3 12:05:45 网站建设 项目流程

选择TypeSafe三大AI决策原语:TypeSafe Agent Skills中Choice、Noul与Score完全指南

【免费下载链接】skillsAgent skills for building with TypeSafe's System One API项目地址: https://gitcode.com/gh_mirrors/skills60/skills

TypeSafe Agent Skills 是一套面向 Agent 开发者的 AI 决策技能,它将 TypeSafe 的 System One 模型(旗舰模型 Jev)封装成"带类型的判断 + 概率",让代码可以直接消费 AI 的常识性判断。本文将完整讲解 TypeSafe Agent Skills 中的三大 AI 决策原语——Choice、Noul 与 Score,帮助新手快速判断每个场景该选哪一个,并正确使用它们的概率与置信度。

什么是 TypeSafe Agent Skills:把"AI 常识"变成编程原语 💡

TypeSafe 的核心理念是:把 AI 的智能切成可编程的小单位,像使用编程原语一样使用它们。与"生成一段文字再解析"的传统 LLM 用法不同,System One 模型返回的是快速的、聚焦的判断(typed judgments)和概率,而不是自由文本:

  • 代码掌控工作流:规则、计算、精确查找、执行都留在代码里
  • 模型提供可编程常识:只在需要语义理解的地方引入 AI 判断
  • 输出是结构化的:类型化的答案 + 概率,代码可以稳定组合、复用

这套理念完整写在技能文件 skills/typesafe-ai/SKILL.md 中,它是理解三大原语的最佳起点。

快速上手:三步安装 TypeSafe Agent Skills

安装方式见 README.md,只需两步命令即可完成:

方式一:Claude Code 插件

claude plugin marketplace add typesafe-ai/skills claude plugin install typesafe@typesafe-ai

方式二:其他 Agent(通过 skills.sh)

npx skills add typesafe-ai/skills --skill typesafe-ai

按提示选择你的 Agent 即可;默认安装为项目级,加-g参数可全局安装。安装后直接用自然语言向 Agent 提问即可,例如:"用 TypeSafe 把客服工单按部门路由,不确定的交人工复核"。在 Claude Code 中也可以显式调用/typesafe:typesafe-ai。

三大 AI 决策原语一览:Choice、Noul、Score 怎么选 🎯

设计判断时,按"答案的含义"选择原语,这是 SKILL 文件给出的核心选择表(原文见 SKILL.md 选择表):

你的需求原语关键区别
答案是一组定义好的选项之一Choice只选一个选项,其概率分布用于比较各竞争选项
判断某个条件是否成立Noul返回"是"的概率,没有单独的置信度;多个标签可能同时命中时,每个标签单独问一次
衡量某个维度上的程度Score在有序等级上的概率加权位置;对同类条目分别打分可做分级排序

一句话记忆:Choice 选一个,Noul 判是否,Score 量程度。

Choice:从选项中挑一个(路由、分派类场景)

适合场景:把请求路由到某个处理分支、工单分派到某个部门、识别用户意图等"从固定集合里选一个"的任务。

  • 返回选中的那一个选项,同时给出完整的概率分布,方便代码比较各选项的强弱
  • 概率分布"分散"意味着模型认为多个选项都有竞争力——这本身就是有价值的信号
  • 注意:低置信度不一定代表答案错误。多个选项本来就合理时(比如无伤大雅的偏好选择),概率天然会分散,此时不必强制人工介入

设计技巧:如果"什么都不匹配"也是一种合法结果,记得把"无匹配"作为一个显式选项保留,否则模型没有退路。

Noul:判断一个条件是否成立(布尔类场景)

适合场景:"这条评论是否违规?""该字段是否缺失?""这句话是否包含地址信息?"等是非判断题。

  • 返回"是"的概率,没有单独的置信度——概率本身就是判断依据
  • ⚠️ 常见误区:Noul 接近 0.5 表示"是"与"否"的概率相当(模型拿不准),而不是"中等程度"。Noul 只回答是否,不衡量强度
  • 多个标签可能同时命中时,每个标签单独问一个 Noul:例如"是否含攻击性语言"和"是否含广告"应拆成两个独立判断,它们可以并行执行、互不影响

Score:衡量维度上的程度(排序、分级类场景)

适合场景:文档相关性排序、风险等级评估、情感强度等需要"程度"而非"是否"的任务。

  • 返回在有序等级上的概率加权位置,而不是单一数字
  • 对同类条目使用可比的 Score(同一套等级定义),就能实现分级排序与筛选
  • 设计要点:每个等级必须描述具体情境且能独立成立,避免"一般""较好"这类含糊措辞
  • 最大的工程红利:Score 只需打一次分,之后代码可以自由调整权重、阈值、排序和展示视图,甚至无需重新调用模型;这些打分还能作为传统机器学习特征使用(参考 SKILL 文件中的 复合评分模式)

概率与置信度:避免三个高频误用 ✅

SKILL 文件(相关段落)特别强调了使用概率的正确姿势:

  1. 置信度 ≠ 正确率。Choice/Score 的置信度只概括"分布的集中程度",它不代表整个工作流正确,更不是"可以自动执行"的授权——阈值要基于自己的数据和业务后果来定
  2. Noul ≈ 0.5 是"拿不准",不是"中等强度",别用它当程度计
  3. 没走的分支不用看。多个并行判断中,未被采纳分支的不确定性可以直接忽略

此外,独立的问题应基于同一份状态一起发出,它们并行运行、互相看不见答案;只有当"上一个答案决定下一个问题"时才发起第二轮请求——多问会增加 token 消耗,要实测成本与延迟。

动手设计你的第一个判断:三条实用建议 ✍️

来自 SKILL.md 设计章节 的核心建议:

  • 每个问题只问一个窄而连贯的判断:独立有用的维度要拆开问,但别把"正在判断的关系"拆碎
  • 给足状态(state):把源文本、身份、关系、策略、当前事实放进命名清晰的字段里;模型无法选择你没提供的候选值
  • 把策略留在代码里:原始判断保持可复用,加权和、阈值、"任一严重违规"这类规则都交给代码,改权重时无需重跑推理

延伸阅读:项目内文件导航

文件说明
README.md项目简介、两种安装方式与调用示例
skills/typesafe-ai/SKILL.md核心技能文件:编程模型、原语选择、置信度与调试指南
skills/typesafe-ai/SKILL.md#L46-L53按任务类型(理解模型、准备输入、处理不确定性等)的快速导航表
LICENSEMIT 开源协议

三大原语只是起点:把它们围绕用户目标自由组合——路由与填充参数、"选择而非生成"、证据检索与评判、把判断沉淀为可复用数据、校验与人工升级——都能搭出完整的 AI 工作流。现在就可以安装 TypeSafe Agent Skills,让你的 Agent 拥有可编程的常识 🚀

【免费下载链接】skillsAgent skills for building with TypeSafe's System One API项目地址: https://gitcode.com/gh_mirrors/skills60/skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询