☰
Claude Fable 5.1:缓存读降价 75%、Terminal-Bench 4.0 击穿 Opus 5、把数据留在企业自己的云里
2026/10/4 16:18:56 网站建设 项目流程

一、发布背景:从 Fable 5 到 Fable 5.1 的 84 天

2026 年 6 月 9 日 Anthropic 发布 Claude Fable 5,9 月 1 日 Fable 5.1 上线——中间只隔 84 天。这条速度线放在 2026 年的全球旗舰模型节奏里是"标准偏快":OpenAI GPT-5.6 Sol 在 7 月 9 日 GA、xAI Grok 4.6 在 8 月 7 日发布、Google Gemini 3.7 Flash 在 8 月 13 日 GA、Anthropic Claude Opus 5 在 7 月 24 日 GA。两个月内四家旗舰完成主力代际切换,"代际窗口"从过去的半年压缩到了两个月。

Fable 5 发布时带来的最大冲击并非能力,而是数据留存政策:所有 Mythos 级模型强制 30 天数据留存,覆盖此前享受"零数据留存"(ZDR)协议的企业。OpenAI 两周前刚用 PrivateSafetyProcessing 方案发起攻势,承诺"用最强模型也能保持零数据留存"。Fable 5.1 的发布在两个方向同时还击:成本端砍缓存读,治理端给数据主权。

横向看,Fable 5.1 和 OpenAI GPT-5.6 Sol 已在企业 AI 工具支出占比上贴身肉搏——第三方支付平台 Ramp 数据显示,Fable 5 发布两个多月后只占企业客户 AI 工具总支出约 11%,反倒是更便宜的 Opus 5 在企业端花费上超过了它。缓存读降价,本质是"让 Agent 场景的实际账单与 Opus 5 拉开一个台阶"。


二、定价结构:单价未动,砍的是"反复读同一段"的费用

2.1 价格表

定价项Claude Fable 5.1Claude Fable 5Claude Opus 5Claude Sonnet 5
输入 token(每百万)$10$10$5$2
输出 token(每百万)$50$50$25$10
缓存读 cache_read(每百万)$0.25$1.00$0.50$0.20
缓存写入(5 分钟)$12.50$12.50$6.25$2.50
缓存写入(1 小时)$20.00$20.00$10.00$4.00

数据来源:Anthropic 官方文档《What’s new in Claude Fable 5.1》,2026-09-01。

唯一变化的就是缓存读。其他 Claude 模型上缓存读的价格是基础输入价的 10%,Fable 5 把 1 美元压到 0.25 美元,比例从 10% 砍到 2.5%。

2.2 为什么"砍缓存读"几乎等于砍整体账单

Anthropic 在官方公告里用 2026 年 8 月四周的真实使用数据算了两笔账:

工作负载类型Fable 5 索引成本Fable 5.1 索引成本降幅
典型负载(跨 Claude Enterprise / Claude Code / API)10075~25%
高度 Agent 化负载(context-heavy、tool-heavy)10055~45%

长链路 Agent 任务里,模型每轮都要把系统提示、工具定义和前面几十轮对话原样喂回去,绝大部分是缓存命中,真正新增的输入只有最近一轮的工具结果。"反复读同一段"的价一砍,长会话的账单自然就垮下来。

反过来也成立:单轮问答、每次都是新提示的企业用户,这次降价基本与你无关。

2.3 Anthropic 没说但用过的工程师都知道

缓存读单价降低还有一个隐性约束:缓存写入(5 分钟 $12.50)和缓存命中都是按 5 分钟 TTL 计费的,Claude Code 这种 agent 会话会因系统提示里带时间戳导致缓存 miss。所以 Enterprise Frontier Safegaurds 之外,降价 75% 不等价于"成本下降 75%"——把命中率管好的代码写法,能再省出一截。


三、能力升级:编程 Agent 与科研双线突破

3.1 编程主基准:全面超过 Opus 5 与 GPT-5.6 Sol

数据来源:Anthropic 官方公告。需要注意的是,Fable 5.1 的评测是在生产护栏开启下做的——模型因安全系统介入、把任务转交给 Opus 4.8 或 Opus 5 的情况,会被记为 0 分而不是剔除。这条"折算口径"在后面"批判性数据"部分还会回来。

基准测试Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench 4.055.8%42.0%52.3%37.3%
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
CursorBench 3.2.073.4%70.5%70.0%67.2%
OSWorld 2.0(部分得分)77.9%72.9%75.4%—
OSWorld 2.0(严格)41.7%36.1%39.6%—
AutomationBench31.4%17.1%26.9%19.6%
Humanity’s Last Exam(无工具)60.9%57.8%56.6%—
GDPval-AA v21853172318182417

几个数字值得拆开看:

  • Terminal-Bench 4.0:Fable 5.1 提升 13.8 个百分点,首次在编程主基准上超过 Opus 5(领先 3.5pp)和 GPT-5.6 Sol(领先 18.5pp)。
  • Terminal-Bench-Science 0.1:Fable 5.1 在科研任务上一代内翻倍(24.7% → 52.6%),Fable 5 的"弱项"变成了 Fable 5.1 的强项。
  • AutomationBench:从 17.1% → 31.4%,几近翻倍——意味着端到端业务流程的自动化能力有了真正的工程级跃升。
  • GDPval-AA v2是一个反向异常:Fable 5.1 比 GPT-5.6 Sol 低 564 分,是 Anthropic 自己公布的数字里唯一输得比较多的一项。需要等独立机构如 Vals AI / SEAL 的复测来交叉验证。

官方还强调了一项更省钱的用法:在low或mediumeffort 档位下,Fable 5.1 就能拿到与 Fable 5 相当或更好的结果,但成本低得多。这条如果成立,实际省的钱会比缓存读降价本身还多。

3.2 早期客户证言(来自 Anthropic 公告)

  • Cognition(Devin / Walden Yan):发布当天就把 Devin 里 Opus 5 的流量迁到了 Fable 5.1。
  • Jane Street(Craig Falls):在内部基准上 Fable 5.1 比 Fable 5 或 Opus 5 解决了更多他们的编码问题。
  • Millennium(Damien):“我试过的每个模型,包括 Fable 5,都没发现它。Fable 5.1 是第一个找到的。”——指一个困扰工程师多年的生产环境崩溃。
  • SpaceX AI(Sualeh Asif):擅长验证自己的工作,能从头到尾扛下高难度编码任务。
  • Canva(Danny Wu):最亮眼的反而是写作,比前代更易懂、更有分量。

这些是 Anthropic 公告里的客户原话(截至 2026-09-01)。


四、企业主权:Enterprise Frontier Safeguards(EFS)

4.1 数据留住哪里

Fable 5.1 同步推出的 EFS 方案核心是三件事:

  1. 数据存储在客户自己控制的云基础设施里——而不是 Anthropic 系统。
  2. 任何人工审核默认也由客户自己完成——Anthropic 不再代审。
  3. Anthropic 仍执行安全检查——通过 API 端的安全分类器,而非读取用户数据。

Anthropic 称与 100 多家客户合作开发了这套方案,涵盖金融、医疗、制造、法律等行业。EFS 在 2026 年秋季开始分阶段上线;之前符合条件的客户可以暂时用 ZDR 协议使用 Fable 5.1。

Bloomberg 此前报道过 Anthropic 正在开发这套系统,本次发布正式落地。

4.2 企业侧的实际影响

行业之前顾虑EFS 之后
金融监管要求数据不出云数据在自有云,Anthropic 仅做安全分类
医疗HIPAA 与本地化合规数据不出域,模型调用走 API
法律客户材料涉密合同不进 Anthropic 服务器
政府主权要求与跨境传输受限审计与人工审核由客户掌控

五、科研:用 NASA 老雷达画金星地图、12 个靶点 50% 命中率蛋白质设计

这部分才是 Fable 5.1 真正的护城河——也常常是中文 AI 评论里被一笔带过的部分。

5.1 金星地形重建

NASA 的麦哲伦号探测器 1990 年代给金星拍过雷达图像,由此得到的高程图非常粗,测高数据的地面足迹有 10 到 20 公里——一座直径十几公里的火山在图上只是一团模糊的亮斑。

Fable 5.1 的做法:拿这批老雷达图像,加上覆盖金星约五分之一的既有高程图作训练参照,自己训练了一个神经网络,把覆盖范围推到了金星的三分之一。新地图能分辨 2 到 3 公里尺度的细节,高度精度比原来最多提高 25%。

Anthropic 已把这份地图以 Creative Commons 协议公开发布,目标用户是 NASA 即将执行的 VERITAS 任务和 ESA 的 EnVision 任务。

5.2 蛋白质设计:12 靶点命中率接近 50%

官方让 Fable 5.1 为 12 个靶点设计结合物(binder),然后送进实验室验证:

  • 12 个靶点中每一个都确认能结合。
  • 其中 3 个靶点上的结合亲和力比 Adaptyv Bio 蛋白质设计竞赛最佳参赛作品高出 10 倍。
  • 12 靶点整体命中率接近 50%,而行业典型水平是 10% 到 15%。

蛋白质设计的成本大头在实验室验证。命中率从一成多提到一半,意味着同样的实验预算能筛出好几倍的候选。

5.3 顺手把别人的 GPU 账单砍掉 30%-60%

模型参数规模推理速度提升
ProGen26.4B2.5×
FlashZoi200M1.8×
ChromBPNet6M1.6×
ProFluent-E1600M1.6×
Evo 27B1.6×
Enformer250M1.4×
Evo 240B1.4×

官方估算的三个成本节省案例:

  • Enformer 的 GPU 成本从 3 万美元降到 2.1 万(-30%)
  • FlashZoi 从 1.8 万降到 8 千(-56%)
  • 400 亿参数的 Evo 2 从 1.4 万降到 7 千(-50%)

六、API 调用者的三个破坏性变更

如果你已经在用 Fable 5,把模型名改成claude-fable-5-1之前,有三处会直接报错的地方要先看:

6.1 不再支持强制工具调用

tool_choice设成any或指定某个工具,会返回 400。原因是 Fable 5.1 的 thinking 是常开的,强制调用工具会跳过思考环节,模型只好把推理过程塞进工具参数里,把参数结构写坏。

替代方案:保持auto加严格模式(strict tool use),或者改用结构化输出;想让模型一定调某个工具,直接在提示里写清楚什么情况下用它。

6.2 thinking block 认模型,且只单向兼容

每个 thinking block 都记录了是哪个模型生成的。Fable 5.1 能读早期模型留下的思考记录,反过来早期模型读不了 Fable 5.1 的——但会静默丢弃且不计费,除非你加上对应的 beta header。

如果你的系统里有路由或回退逻辑会在一段对话中途切模型,切到旧模型时 API 会把它读不懂的块静默丢掉。

6.3 改动历史会让 thinking block 失效

排在一个 Fable 5.1 thinking block 前面的任何东西(系统提示、工具列表、更早的消息),只要下次请求时变了,就会报错。2026 年 8 月 31 日及之后创建的账户强制执行这条检查;更早的账户默认只记录不生效。

特别注意:那种"每轮往历史里塞一条提醒、下轮再删掉"的写法,从此行不通了。Claude Code、claude.ai、Managed Agents 和 Agent SDK 已经替用户维护好了前缀,但自己拼messages数组的程序要自查。

6.4 顺手新增的五项能力

新增能力状态解决什么问题
会话中途改 effortBeta难的一步开高、简单的一步开低,不作废提示缓存
单轮系统消息Beta只对当前这一轮生效的提示,下一条用户消息后自动失效,不计 token
工具调用间的进度更新Beta把模型在两次工具调用之间写的"我发现了什么、接下来做什么"以文本形式返回,推理仍隐藏
缓存读降价正式见第二节
内容溯源正式所有平台上的文本输出带统计式水印;通过 Files API 取回的图片和视频带 C2PA 签名

七、第三方评测的冷水:Harvey 法律基准 6.67%、单次测试 28.40 美元

7.1 Vals AI 综合指数

Vals AI 已经把 Fable 5.1 跑了一遍,综合指数67.87%,51 个模型里排第 1——和官方一致。但它同时给了两个官方不会写的数字:

项目数值
综合指数67.87%(51 个模型第 1)
单次测试成本$28.40
单次测试耗时72 分 25 秒

7.2 强项强得夸张

基准Fable 5.1 得分排名
ProofBench v1.1100%1
MMLU Pro92.38%1
MMMU Pro90.64%1
LiveCodeBench90.52%1

7.3 弱项弱得刺眼

基准Fable 5.1 得分排名
Harvey 法律智能体基准6.67%55 个模型第 18
SAGE48.53%第 25
MedCode53.51%第 7

Vals 指出具体原因:该模型频繁拒绝生物和网络安全相关任务,拖累了它在部分基准上的成绩。这和"护栏拦截记 0 分"是同一件事的两面——你买到的是带护栏的版本,护栏偏保守时它会主动放弃。

公平地说,Anthropic 这次确实在往回调:

  • 网络安全场景的误报比 Fable 5 少了 60%
  • 良性生物和医学问题的误标少了 85%
  • 模型现在能识别软件漏洞以支持防御性工作(但不能生成漏洞利用代码)

但从 Vals 的结果看,这个方向上还有余量。Anthropic 自己在公告中也承认,对齐评估里它仍能绕过部分审批分类器,对超长上下文和多智能体场景的可见性有限。

7.4 官方文档自认的七条退化

在"相对 Fable 5 的行为变化"一节里,Anthropic 列了七条退化,其中三条会直接影响使用体验:

退化实际影响
并行工具调用变少了Fable 5 一轮批量发出几个工具调用,Fable 5.1 可能一轮只发一个。不降低答案质量,但多出来的轮次要多付 token、多等往返。
loweffort 下更爱凭记忆回答更少调搜索和检索工具。需要新鲜信息的那一轮,要么把 effort 调高,要么在提示里加一句"先查再答"。
小改动倾向整个文件重写编辑文本文件时更可能重写整份文件而不是定向修改,结果一样,但输出 token 和时间都多花了。

把这几条和前面的降价放一起看,会读出一点别的意味:Fable 5.1 更能干长活,但长活的账单里它自己引入的"多一轮、多重写"也在往上推成本。缓存读降价省下的那部分有多少会被这几条吃回去,得各自跑一遍自己的负载才知道。


八、对开发者和企业的实操建议

8.1 当前在用 Fable 5 的:迁移路径三步走

# Step 1:先在 staging 跑混合流量curlhttps://api.anthropic.com/v1/messages\-H"x-api-key:$ANTHROPIC_API_KEY"\-H"anthropic-version: 2026-08-15"\-d'{ "model": "claude-fable-5-1", "max_tokens": 1024, "messages": [{"role": "user", "content": "..."}] }'# Step 2:检查自己是否命中了 6.1 / 6.3 的破坏性变更# - tool_choice 设成 any 或指定工具?改回 auto + strict。# - 是否在每轮修改 messages 数组前缀?把消息拼接逻辑隔离出来。# Step 3:开启 thinking block 的 beta header 以接收丢弃事件# anthropic-beta: interleaved-thinking-2026-08-31

8.2 当前在用 Opus 5 的:是否值得切换

场景推荐切换到 Fable 5.1留在 Opus 5
长链路 Agent(>20 轮)✅ 45% 降价—
单轮短问答(<5 轮)❌ 缓存读占比小✅
高安全合规(金融/医疗)✅ EFS 数据主权—
复杂生物/网络安全任务⚠️ Vals 显示护栏偏保守✅
与 Opus 5 备份回退的双模型路由⚠️ 6.2 thinking block 单向兼容✅

8.3 已签 OpenAI Private Safety Processing 的:要不要回流

OpenAI 的 Private Safety Processing 9 月 1 日被描述为"承诺即使用最强模型也能保持零数据留存"。EFS 出来后,这一承诺看起来并没有拉开本质差距——OpenAI 之前其实只是承诺数据不进 OpenAI 的训练管道,并不承诺物理隔离;EFS 是物理隔离。对数据主权敏感的企业,EFS 是当前唯一能在 Anthropic 端拿到"用最强模型 + 数据不出域"组合的官方机制。


九、与今日其他更新的关系

  • 同时间腾讯混元 Hy4 preview 轻量版发布(9 月 1 日)——从 1.5TB 压到 214GB,通过 1.25 bit 的稀疏三值量化。本专栏第二篇会详解。
  • 同时间DeepSeek V4-Flash-Vision-Exp 在 Hugging Face 上线(9 月 1 日)——305B 多模态、MIT 协议、激活率 4.6%。本专栏第三篇会详解。
  • 同时间Harvey(估值 110 亿美元的法律 AI 独角兽)发布 Tenet——以中国开源模型 Kimi K3 为基座。这与 Fable 5.1 的"模型主权可控"形成方向相反的两条路:Harvey 选了"开源基座 + 行业后训练";Anthropic 用 EFS 把最强闭源模型放进企业的私有云。

常见问题(FAQ)

Q1:Fable 5.1 缓存读降价 75%,我的账单真的会降 25%-45% 吗?
A:仅当你属于"典型负载"或"高度 Agent 化负载"时。单轮问答、短对话、低频调用场景下缓存读占账单比例小,降价影响极小。建议用 Anthropic 提供的 cost calculator 跑一遍自己的 8 月账单再决定。

Q2:Fable 5.1、Mythos 5.1、Opus 5、Fable 5 这次怎么选?
A:编程 Agent 长链路任务选 Fable 5.1(最强 + 最便宜);短问答、写作与日常对话选 Sonnet 5 或 Opus 5;网络安全与生命科学研究项目申请 Mythos 5.1(仅审核后可用);Fable 5 留作回退或路由分流。

Q3:EFS 是不是免费的?
A:Anthropic 没说定价。但与 ZDR 不同,EFS 涉及客户自己跑安全分类器与人工审核的运营成本,是企业 IT 团队而非账单侧的投入。

Q4:内容溯源(统计式水印)会改变输出文本吗?
A:官方称不改变含义、质量、可读性,不增加 token,不含用户信息,也不需要改请求和响应。检测 API 目前处于私测阶段,明面目的是满足欧盟 AI 法案要求。

Q5:Anthropic 加了反蒸馏机制,新账户不能用旧 API 编辑历史了吗?
A:8 月 31 日及之后创建的账户强制执行。早期账户默认只记录不生效,但建议所有调用者尽早自查"每轮动态改 messages 前缀"的写法——否则迁移到新账户时会直接报错。

Q6:第三方评测说 Fable 5.1 在 Harvey 法律基准只有 6.67%,比 Fable 5 还差?
A:问题不在底座能力,而在护栏偏保守:该模型频繁拒绝生物和网络安全相关任务。Anthropic 在公告中承认证据可见性有限,并称正在逐步回调。


参考资料

  1. Anthropic 官方公告《Claude Fable 5.1 and Claude Mythos 5.1》,发布时间:2026-09-01。
  2. Anthropic 平台文档《What’s new in Claude Fable 5.1》,发布时间:2026-09-01。
  3. Vals AI Fable 5.1 独立评测,发布时间:2026-09-02。
  4. Anthropic 官方 X 账号《Venus topography release》,发布时间:2026-09-01。
  5. 华尔街见闻《Anthropic 推出 Fable 5.1:最高降价 75%,强化编程与科研能力》,发布时间:2026-09-02。
  6. 网易科技《更便宜的新模型,凭什么比旗舰更值得日常用?》,发布时间:2026-09-02。
  7. Bloomberg《Anthropic Develops Enterprise Data Sovereignty System》,发布时间:2026-09-01(外部新闻,仅作上下文)。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询