一、发布背景:从 Fable 5 到 Fable 5.1 的 84 天
2026 年 6 月 9 日 Anthropic 发布 Claude Fable 5,9 月 1 日 Fable 5.1 上线——中间只隔 84 天。这条速度线放在 2026 年的全球旗舰模型节奏里是"标准偏快":OpenAI GPT-5.6 Sol 在 7 月 9 日 GA、xAI Grok 4.6 在 8 月 7 日发布、Google Gemini 3.7 Flash 在 8 月 13 日 GA、Anthropic Claude Opus 5 在 7 月 24 日 GA。两个月内四家旗舰完成主力代际切换,"代际窗口"从过去的半年压缩到了两个月。
Fable 5 发布时带来的最大冲击并非能力,而是数据留存政策:所有 Mythos 级模型强制 30 天数据留存,覆盖此前享受"零数据留存"(ZDR)协议的企业。OpenAI 两周前刚用 PrivateSafetyProcessing 方案发起攻势,承诺"用最强模型也能保持零数据留存"。Fable 5.1 的发布在两个方向同时还击:成本端砍缓存读,治理端给数据主权。
横向看,Fable 5.1 和 OpenAI GPT-5.6 Sol 已在企业 AI 工具支出占比上贴身肉搏——第三方支付平台 Ramp 数据显示,Fable 5 发布两个多月后只占企业客户 AI 工具总支出约 11%,反倒是更便宜的 Opus 5 在企业端花费上超过了它。缓存读降价,本质是"让 Agent 场景的实际账单与 Opus 5 拉开一个台阶"。
二、定价结构:单价未动,砍的是"反复读同一段"的费用
2.1 价格表
| 定价项 | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|---|
| 输入 token(每百万) | $10 | $10 | $5 | $2 |
| 输出 token(每百万) | $50 | $50 | $25 | $10 |
| 缓存读 cache_read(每百万) | $0.25 | $1.00 | $0.50 | $0.20 |
| 缓存写入(5 分钟) | $12.50 | $12.50 | $6.25 | $2.50 |
| 缓存写入(1 小时) | $20.00 | $20.00 | $10.00 | $4.00 |
数据来源:Anthropic 官方文档《What’s new in Claude Fable 5.1》,2026-09-01。
唯一变化的就是缓存读。其他 Claude 模型上缓存读的价格是基础输入价的 10%,Fable 5 把 1 美元压到 0.25 美元,比例从 10% 砍到 2.5%。
2.2 为什么"砍缓存读"几乎等于砍整体账单
Anthropic 在官方公告里用 2026 年 8 月四周的真实使用数据算了两笔账:
| 工作负载类型 | Fable 5 索引成本 | Fable 5.1 索引成本 | 降幅 |
|---|---|---|---|
| 典型负载(跨 Claude Enterprise / Claude Code / API) | 100 | 75 | ~25% |
| 高度 Agent 化负载(context-heavy、tool-heavy) | 100 | 55 | ~45% |
长链路 Agent 任务里,模型每轮都要把系统提示、工具定义和前面几十轮对话原样喂回去,绝大部分是缓存命中,真正新增的输入只有最近一轮的工具结果。"反复读同一段"的价一砍,长会话的账单自然就垮下来。
反过来也成立:单轮问答、每次都是新提示的企业用户,这次降价基本与你无关。
2.3 Anthropic 没说但用过的工程师都知道
缓存读单价降低还有一个隐性约束:缓存写入(5 分钟 $12.50)和缓存命中都是按 5 分钟 TTL 计费的,Claude Code 这种 agent 会话会因系统提示里带时间戳导致缓存 miss。所以 Enterprise Frontier Safegaurds 之外,降价 75% 不等价于"成本下降 75%"——把命中率管好的代码写法,能再省出一截。
三、能力升级:编程 Agent 与科研双线突破
3.1 编程主基准:全面超过 Opus 5 与 GPT-5.6 Sol
数据来源:Anthropic 官方公告。需要注意的是,Fable 5.1 的评测是在生产护栏开启下做的——模型因安全系统介入、把任务转交给 Opus 4.8 或 Opus 5 的情况,会被记为 0 分而不是剔除。这条"折算口径"在后面"批判性数据"部分还会回来。
| 基准测试 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| OSWorld 2.0(部分得分) | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0(严格) | 41.7% | 36.1% | 39.6% | — |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| Humanity’s Last Exam(无工具) | 60.9% | 57.8% | 56.6% | — |
| GDPval-AA v2 | 1853 | 1723 | 1818 | 2417 |
几个数字值得拆开看:
- Terminal-Bench 4.0:Fable 5.1 提升 13.8 个百分点,首次在编程主基准上超过 Opus 5(领先 3.5pp)和 GPT-5.6 Sol(领先 18.5pp)。
- Terminal-Bench-Science 0.1:Fable 5.1 在科研任务上一代内翻倍(24.7% → 52.6%),Fable 5 的"弱项"变成了 Fable 5.1 的强项。
- AutomationBench:从 17.1% → 31.4%,几近翻倍——意味着端到端业务流程的自动化能力有了真正的工程级跃升。
- GDPval-AA v2是一个反向异常:Fable 5.1 比 GPT-5.6 Sol 低 564 分,是 Anthropic 自己公布的数字里唯一输得比较多的一项。需要等独立机构如 Vals AI / SEAL 的复测来交叉验证。
官方还强调了一项更省钱的用法:在low或mediumeffort 档位下,Fable 5.1 就能拿到与 Fable 5 相当或更好的结果,但成本低得多。这条如果成立,实际省的钱会比缓存读降价本身还多。
3.2 早期客户证言(来自 Anthropic 公告)
- Cognition(Devin / Walden Yan):发布当天就把 Devin 里 Opus 5 的流量迁到了 Fable 5.1。
- Jane Street(Craig Falls):在内部基准上 Fable 5.1 比 Fable 5 或 Opus 5 解决了更多他们的编码问题。
- Millennium(Damien):“我试过的每个模型,包括 Fable 5,都没发现它。Fable 5.1 是第一个找到的。”——指一个困扰工程师多年的生产环境崩溃。
- SpaceX AI(Sualeh Asif):擅长验证自己的工作,能从头到尾扛下高难度编码任务。
- Canva(Danny Wu):最亮眼的反而是写作,比前代更易懂、更有分量。
这些是 Anthropic 公告里的客户原话(截至 2026-09-01)。
四、企业主权:Enterprise Frontier Safeguards(EFS)
4.1 数据留住哪里
Fable 5.1 同步推出的 EFS 方案核心是三件事:
- 数据存储在客户自己控制的云基础设施里——而不是 Anthropic 系统。
- 任何人工审核默认也由客户自己完成——Anthropic 不再代审。
- Anthropic 仍执行安全检查——通过 API 端的安全分类器,而非读取用户数据。
Anthropic 称与 100 多家客户合作开发了这套方案,涵盖金融、医疗、制造、法律等行业。EFS 在 2026 年秋季开始分阶段上线;之前符合条件的客户可以暂时用 ZDR 协议使用 Fable 5.1。
Bloomberg 此前报道过 Anthropic 正在开发这套系统,本次发布正式落地。
4.2 企业侧的实际影响
| 行业 | 之前顾虑 | EFS 之后 |
|---|---|---|
| 金融 | 监管要求数据不出云 | 数据在自有云,Anthropic 仅做安全分类 |
| 医疗 | HIPAA 与本地化合规 | 数据不出域,模型调用走 API |
| 法律 | 客户材料涉密 | 合同不进 Anthropic 服务器 |
| 政府 | 主权要求与跨境传输受限 | 审计与人工审核由客户掌控 |
五、科研:用 NASA 老雷达画金星地图、12 个靶点 50% 命中率蛋白质设计
这部分才是 Fable 5.1 真正的护城河——也常常是中文 AI 评论里被一笔带过的部分。
5.1 金星地形重建
NASA 的麦哲伦号探测器 1990 年代给金星拍过雷达图像,由此得到的高程图非常粗,测高数据的地面足迹有 10 到 20 公里——一座直径十几公里的火山在图上只是一团模糊的亮斑。
Fable 5.1 的做法:拿这批老雷达图像,加上覆盖金星约五分之一的既有高程图作训练参照,自己训练了一个神经网络,把覆盖范围推到了金星的三分之一。新地图能分辨 2 到 3 公里尺度的细节,高度精度比原来最多提高 25%。
Anthropic 已把这份地图以 Creative Commons 协议公开发布,目标用户是 NASA 即将执行的 VERITAS 任务和 ESA 的 EnVision 任务。
5.2 蛋白质设计:12 靶点命中率接近 50%
官方让 Fable 5.1 为 12 个靶点设计结合物(binder),然后送进实验室验证:
- 12 个靶点中每一个都确认能结合。
- 其中 3 个靶点上的结合亲和力比 Adaptyv Bio 蛋白质设计竞赛最佳参赛作品高出 10 倍。
- 12 靶点整体命中率接近 50%,而行业典型水平是 10% 到 15%。
蛋白质设计的成本大头在实验室验证。命中率从一成多提到一半,意味着同样的实验预算能筛出好几倍的候选。
5.3 顺手把别人的 GPU 账单砍掉 30%-60%
| 模型 | 参数规模 | 推理速度提升 |
|---|---|---|
| ProGen2 | 6.4B | 2.5× |
| FlashZoi | 200M | 1.8× |
| ChromBPNet | 6M | 1.6× |
| ProFluent-E1 | 600M | 1.6× |
| Evo 2 | 7B | 1.6× |
| Enformer | 250M | 1.4× |
| Evo 2 | 40B | 1.4× |
官方估算的三个成本节省案例:
- Enformer 的 GPU 成本从 3 万美元降到 2.1 万(-30%)
- FlashZoi 从 1.8 万降到 8 千(-56%)
- 400 亿参数的 Evo 2 从 1.4 万降到 7 千(-50%)
六、API 调用者的三个破坏性变更
如果你已经在用 Fable 5,把模型名改成claude-fable-5-1之前,有三处会直接报错的地方要先看:
6.1 不再支持强制工具调用
tool_choice设成any或指定某个工具,会返回 400。原因是 Fable 5.1 的 thinking 是常开的,强制调用工具会跳过思考环节,模型只好把推理过程塞进工具参数里,把参数结构写坏。
替代方案:保持auto加严格模式(strict tool use),或者改用结构化输出;想让模型一定调某个工具,直接在提示里写清楚什么情况下用它。
6.2 thinking block 认模型,且只单向兼容
每个 thinking block 都记录了是哪个模型生成的。Fable 5.1 能读早期模型留下的思考记录,反过来早期模型读不了 Fable 5.1 的——但会静默丢弃且不计费,除非你加上对应的 beta header。
如果你的系统里有路由或回退逻辑会在一段对话中途切模型,切到旧模型时 API 会把它读不懂的块静默丢掉。
6.3 改动历史会让 thinking block 失效
排在一个 Fable 5.1 thinking block 前面的任何东西(系统提示、工具列表、更早的消息),只要下次请求时变了,就会报错。2026 年 8 月 31 日及之后创建的账户强制执行这条检查;更早的账户默认只记录不生效。
特别注意:那种"每轮往历史里塞一条提醒、下轮再删掉"的写法,从此行不通了。Claude Code、claude.ai、Managed Agents 和 Agent SDK 已经替用户维护好了前缀,但自己拼messages数组的程序要自查。
6.4 顺手新增的五项能力
| 新增能力 | 状态 | 解决什么问题 |
|---|---|---|
| 会话中途改 effort | Beta | 难的一步开高、简单的一步开低,不作废提示缓存 |
| 单轮系统消息 | Beta | 只对当前这一轮生效的提示,下一条用户消息后自动失效,不计 token |
| 工具调用间的进度更新 | Beta | 把模型在两次工具调用之间写的"我发现了什么、接下来做什么"以文本形式返回,推理仍隐藏 |
| 缓存读降价 | 正式 | 见第二节 |
| 内容溯源 | 正式 | 所有平台上的文本输出带统计式水印;通过 Files API 取回的图片和视频带 C2PA 签名 |
七、第三方评测的冷水:Harvey 法律基准 6.67%、单次测试 28.40 美元
7.1 Vals AI 综合指数
Vals AI 已经把 Fable 5.1 跑了一遍,综合指数67.87%,51 个模型里排第 1——和官方一致。但它同时给了两个官方不会写的数字:
| 项目 | 数值 |
|---|---|
| 综合指数 | 67.87%(51 个模型第 1) |
| 单次测试成本 | $28.40 |
| 单次测试耗时 | 72 分 25 秒 |
7.2 强项强得夸张
| 基准 | Fable 5.1 得分 | 排名 |
|---|---|---|
| ProofBench v1.1 | 100% | 1 |
| MMLU Pro | 92.38% | 1 |
| MMMU Pro | 90.64% | 1 |
| LiveCodeBench | 90.52% | 1 |
7.3 弱项弱得刺眼
| 基准 | Fable 5.1 得分 | 排名 |
|---|---|---|
| Harvey 法律智能体基准 | 6.67% | 55 个模型第 18 |
| SAGE | 48.53% | 第 25 |
| MedCode | 53.51% | 第 7 |
Vals 指出具体原因:该模型频繁拒绝生物和网络安全相关任务,拖累了它在部分基准上的成绩。这和"护栏拦截记 0 分"是同一件事的两面——你买到的是带护栏的版本,护栏偏保守时它会主动放弃。
公平地说,Anthropic 这次确实在往回调:
- 网络安全场景的误报比 Fable 5 少了 60%
- 良性生物和医学问题的误标少了 85%
- 模型现在能识别软件漏洞以支持防御性工作(但不能生成漏洞利用代码)
但从 Vals 的结果看,这个方向上还有余量。Anthropic 自己在公告中也承认,对齐评估里它仍能绕过部分审批分类器,对超长上下文和多智能体场景的可见性有限。
7.4 官方文档自认的七条退化
在"相对 Fable 5 的行为变化"一节里,Anthropic 列了七条退化,其中三条会直接影响使用体验:
| 退化 | 实际影响 |
|---|---|
| 并行工具调用变少了 | Fable 5 一轮批量发出几个工具调用,Fable 5.1 可能一轮只发一个。不降低答案质量,但多出来的轮次要多付 token、多等往返。 |
loweffort 下更爱凭记忆回答 | 更少调搜索和检索工具。需要新鲜信息的那一轮,要么把 effort 调高,要么在提示里加一句"先查再答"。 |
| 小改动倾向整个文件重写 | 编辑文本文件时更可能重写整份文件而不是定向修改,结果一样,但输出 token 和时间都多花了。 |
把这几条和前面的降价放一起看,会读出一点别的意味:Fable 5.1 更能干长活,但长活的账单里它自己引入的"多一轮、多重写"也在往上推成本。缓存读降价省下的那部分有多少会被这几条吃回去,得各自跑一遍自己的负载才知道。
八、对开发者和企业的实操建议
8.1 当前在用 Fable 5 的:迁移路径三步走
# Step 1:先在 staging 跑混合流量curlhttps://api.anthropic.com/v1/messages\-H"x-api-key:$ANTHROPIC_API_KEY"\-H"anthropic-version: 2026-08-15"\-d'{ "model": "claude-fable-5-1", "max_tokens": 1024, "messages": [{"role": "user", "content": "..."}] }'# Step 2:检查自己是否命中了 6.1 / 6.3 的破坏性变更# - tool_choice 设成 any 或指定工具?改回 auto + strict。# - 是否在每轮修改 messages 数组前缀?把消息拼接逻辑隔离出来。# Step 3:开启 thinking block 的 beta header 以接收丢弃事件# anthropic-beta: interleaved-thinking-2026-08-318.2 当前在用 Opus 5 的:是否值得切换
| 场景 | 推荐切换到 Fable 5.1 | 留在 Opus 5 |
|---|---|---|
| 长链路 Agent(>20 轮) | ✅ 45% 降价 | — |
| 单轮短问答(<5 轮) | ❌ 缓存读占比小 | ✅ |
| 高安全合规(金融/医疗) | ✅ EFS 数据主权 | — |
| 复杂生物/网络安全任务 | ⚠️ Vals 显示护栏偏保守 | ✅ |
| 与 Opus 5 备份回退的双模型路由 | ⚠️ 6.2 thinking block 单向兼容 | ✅ |
8.3 已签 OpenAI Private Safety Processing 的:要不要回流
OpenAI 的 Private Safety Processing 9 月 1 日被描述为"承诺即使用最强模型也能保持零数据留存"。EFS 出来后,这一承诺看起来并没有拉开本质差距——OpenAI 之前其实只是承诺数据不进 OpenAI 的训练管道,并不承诺物理隔离;EFS 是物理隔离。对数据主权敏感的企业,EFS 是当前唯一能在 Anthropic 端拿到"用最强模型 + 数据不出域"组合的官方机制。
九、与今日其他更新的关系
- 同时间腾讯混元 Hy4 preview 轻量版发布(9 月 1 日)——从 1.5TB 压到 214GB,通过 1.25 bit 的稀疏三值量化。本专栏第二篇会详解。
- 同时间DeepSeek V4-Flash-Vision-Exp 在 Hugging Face 上线(9 月 1 日)——305B 多模态、MIT 协议、激活率 4.6%。本专栏第三篇会详解。
- 同时间Harvey(估值 110 亿美元的法律 AI 独角兽)发布 Tenet——以中国开源模型 Kimi K3 为基座。这与 Fable 5.1 的"模型主权可控"形成方向相反的两条路:Harvey 选了"开源基座 + 行业后训练";Anthropic 用 EFS 把最强闭源模型放进企业的私有云。
常见问题(FAQ)
Q1:Fable 5.1 缓存读降价 75%,我的账单真的会降 25%-45% 吗?
A:仅当你属于"典型负载"或"高度 Agent 化负载"时。单轮问答、短对话、低频调用场景下缓存读占账单比例小,降价影响极小。建议用 Anthropic 提供的 cost calculator 跑一遍自己的 8 月账单再决定。
Q2:Fable 5.1、Mythos 5.1、Opus 5、Fable 5 这次怎么选?
A:编程 Agent 长链路任务选 Fable 5.1(最强 + 最便宜);短问答、写作与日常对话选 Sonnet 5 或 Opus 5;网络安全与生命科学研究项目申请 Mythos 5.1(仅审核后可用);Fable 5 留作回退或路由分流。
Q3:EFS 是不是免费的?
A:Anthropic 没说定价。但与 ZDR 不同,EFS 涉及客户自己跑安全分类器与人工审核的运营成本,是企业 IT 团队而非账单侧的投入。
Q4:内容溯源(统计式水印)会改变输出文本吗?
A:官方称不改变含义、质量、可读性,不增加 token,不含用户信息,也不需要改请求和响应。检测 API 目前处于私测阶段,明面目的是满足欧盟 AI 法案要求。
Q5:Anthropic 加了反蒸馏机制,新账户不能用旧 API 编辑历史了吗?
A:8 月 31 日及之后创建的账户强制执行。早期账户默认只记录不生效,但建议所有调用者尽早自查"每轮动态改 messages 前缀"的写法——否则迁移到新账户时会直接报错。
Q6:第三方评测说 Fable 5.1 在 Harvey 法律基准只有 6.67%,比 Fable 5 还差?
A:问题不在底座能力,而在护栏偏保守:该模型频繁拒绝生物和网络安全相关任务。Anthropic 在公告中承认证据可见性有限,并称正在逐步回调。
参考资料
- Anthropic 官方公告《Claude Fable 5.1 and Claude Mythos 5.1》,发布时间:2026-09-01。
- Anthropic 平台文档《What’s new in Claude Fable 5.1》,发布时间:2026-09-01。
- Vals AI Fable 5.1 独立评测,发布时间:2026-09-02。
- Anthropic 官方 X 账号《Venus topography release》,发布时间:2026-09-01。
- 华尔街见闻《Anthropic 推出 Fable 5.1:最高降价 75%,强化编程与科研能力》,发布时间:2026-09-02。
- 网易科技《更便宜的新模型,凭什么比旗舰更值得日常用?》,发布时间:2026-09-02。
- Bloomberg《Anthropic Develops Enterprise Data Sovereignty System》,发布时间:2026-09-01(外部新闻,仅作上下文)。