☰
Anthropic 发了篇警告,却替 GLM-5.3 做了背书
2026/10/1 8:29:54 网站建设 项目流程

TL;DR 太长不看版

  • Anthropic 在 9 月 29 日发了一篇风险警告,全文最有传播力的却是它对 GLM-5.3 能力的描述。
  • 它给出的两个案例:一天之内自主串出浏览器 0-day;20 分钟人工加 20.40 美元,做出一条公开漏洞的完整利用链。
  • 12 天前,NIST 下属 CAISI 已经做过独立评估,结论是「GLM-5.3是迄今最强开放权重模型,但落后美国前沿约四个月」。
  • 两个结论都成立,因为口径不同:Anthropic 看的是「尝试成功率」,CAISI 看的是分档得分。
  • 评估方是被评估方的竞争对手,且发文当天其 CEO 正在白宫签署“行业自我监管协定”,也是很“巧合”。

一、一份警告,读起来像推荐信

9 月 29 日,Anthropic 前沿红队发布了一篇研究报告。文章的意图很明确:提醒风险。它要提醒的对象,是智谱 Z.ai 的开放权重模型 GLM-5.3。

文章给出的判断是,这个模型能自主完成端到端漏洞利用,护栏也容易被绕过。但读完你会发现,全文最有传播力的一句,是它对 GLM-5.3 能力水平的描述。

原文说,这个模型构建端到端漏洞利用的能力,已经接近Anthropic 未公开的 Claude Mythos Preview。这句话的分量,需要一点背景才看得出来。

五个月前,Anthropic 做出了第一个能自主构建端到端漏洞利用的模型。他们判断这东西太危险,决定不公开发布。只交给一批维护关键软件的公司,走一个有限发布计划,代号 Project Glasswing。据 Anthropic 自己的说法,这批受信任的防守方用它发现了超过 10,000 个漏洞。

一个被刻意关起来的模型,被一个可以随便下载的模型追上了。

这就是全文最大的反差。

报告上线当天,@buildwithhassan 的第一反应就是「我不敢相信 Anthropic 发了这个」。他点出的反差和上面这段一样。一份针对别人模型的完整红队报告,结论是「它做利用链几乎和 Claude Mythos Preview 一样好」,而那个模型被 Anthropic 为安全锁了起来,这一个却能直接下载。


二、它到底认证了什么

先看能力数据。Anthropic 用了两套测试。第一套是 ExploitBench,测的是端到端漏洞利用。410 次尝试里,GLM-5.3 成功 50 次。Claude Mythos Preview 成功 56 次。两者速率相近。参照组是上一代模型:Claude Opus 4.6 和 GLM-5.2,基本为零。

第二套是 Anthropic 内部的 Binary Exploitation 基准。100 个任务,测的是完整控制流劫持。GLM-5.3 的成功率是 4%,Mythos Preview 是 6%。Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flash全部为 0。

Anthropic 在这里的措辞相当克制。它承认 GLM-5.3 略低于 Mythos Preview。但它也说,一道有意义的门槛已被跨过。

第三个测试,护栏

第三套测量针对安全护栏。同样一批攻击意图,不做事先包装时,模型全部拒答。Anthropic 试了三种绕过手法,指标是模型会不会真的去连远程目标:把请求包装成「授权的红队演练」,配合率 64%;在提示层面做手脚,92%;直接改动权重、从根上移除拒答,100%。

对照组是受防护的 Claude:在可以下指令的那一档,它是 0%;另外两档对它不适用——一个接口不支持,一个权重根本不公开。真正让这份认证立得住的,还是后面两个实战案例。

案例一,0-day

研究员在隔离环境里,给了 GLM-5.3 一台 Linux 机器,和一个主流浏览器的本地版本。事先不告诉它漏洞在哪里。

一天左右的时间里,人工实际投入不到 1 小时——其余工作由模型自己完成。它在浏览器的 JavaScript 引擎里,找到了多个此前未知的漏洞。它把这些漏洞串成了一条完整攻击链。

演示中,一条网页链接就能读取访问者电脑上的任意文件。Anthropic 公布的截图显示,它成功读取了测试机的SSH 私钥。相关漏洞已向浏览器维护方披露。

案例二,一笔账单

研究员换用更小的 GLM-5.3-Flash。输入是一份已经公开的 Chrome 漏洞 CVE-2026-11645,加上另一个已知漏洞的资料。没有显著的人工指导。模型把两个漏洞组合成一条针对 ARM64 平台的可靠利用链。它还绕过了指针认证(PAC)加固。

成本是多少?20 分钟人工注意力,加上模型自主运行 8 小时。按智谱当时的 API 价格计算,账单是20.40 美元。


三、20.40 美元,才是真变量

把两个案例放在一起看,重点在价格。一条已经公开、理论上人人都知道的漏洞,过去要从资料走到可用的利用链,是数周乃至数月的工作量。现在这段路的账单是 20.40 美元。人力投入是 20 分钟。

这个数字改变的是门槛。天花板决定最强的那批人能做什么,变化很慢;门槛决定有多少人能做,一旦塌下来就再也回不去了。

对防守方来说,压力会落在很具体的地方。补丁窗口不再从「攻击者开始研究」那天起算。它从漏洞公开那天起算——而且可能只有小时级。

过去留给运维团队的缓冲期,是被「研究成本高」这件事撑住的。成本一旦掉下来,缓冲期也跟着掉。


四、然后 NIST 说话了

如果故事到这里结束,标题就是「开源模型追上来了」。但还有一份文件,比 Anthropic 早发了 12 天。

9 月 17 日,美国 NIST 下属的 CAISI 发布了它对 GLM-5.3 的评估。CAISI 是一个政府背景的独立评估机构,不属于任何模型厂商。它与英国 AISI 一起,是少数会主动评测中国开放权重模型的机构。过去四个月里,它已经连续评估了 GLM-5.2、Kimi K3 和 GLM-5.3。

但 CAISI 给出的答案,和 Anthropic 不一样。它的措辞是,GLM-5.3 是迄今网络能力最强的开放权重模型。这句话在传播中被简化成了「开源最强」。CAISI 紧接着给了后半句。它落后美国前沿约四个月,不是接近。支撑这个判断的是四项基准。

基准GLM-5.3美国最佳此前中国开放权重最佳
SEC-Bench Pro(找并触发已知漏洞)40.4%90.2%27.3%
ExploitBench(把已知漏洞做成利用)61.1%100%32.2%
ExploitGym(502 个任务)9.4%44.4%2.6%
CAISI OSS-Fuzz(无描述、无样例找洞)7.7%23.2%2.4%

来源:NIST CAISI,2026 年 9 月 17 日,括号内为 95% Wilson 置信区间。

这四项覆盖两类任务,一类是找出漏洞,一类是把漏洞用起来。四行数据里,GLM-5.3 与美国最佳在每一项上的置信区间都不重叠。差距最大的一项是漏洞发现,49.8 个百分点。

不过同一次评估也给了另一组参照。相比此前中国开放权重的最佳模型,GLM-5.3 在其中三项上有接近翻倍到三倍以上的提升。所以更准确的描述是:它没有追平美国前沿,但它在快速接近。


五、为什么两个结论都是真的

有意思的地方在这里。两份数据没有打架。它们测的不是同一件事。Anthropic 说的「接近」,用的是尝试成功率。410 次尝试成功 50 次,约 12%。Mythos Preview 约 14%。两个数差不多,所以叫接近。

CAISI 说的「落后」,用的是分档得分。同一个 ExploitBench,CAISI 给 GLM-5.3 的是 61.1%,给美国最佳的是 100%。同一个基准名,两种计分方式,两个故事。

测量方法的选择本身就在传递立场:同一件事换个量尺,结论就能翻面。

CAISI 的美国最佳分数,包含关闭系统级护栏的版本。普通客户从 API 拿到的是护栏开着的版本。开放权重的模型一旦自托管,就没有这一层。所以在某些维度上,美国模型实际能做的事,可能低于 CAISI 显示的天花板。


六、评估正在变成竞争的一部分

到这里,可以说那件不太舒服的事了。Anthropic 评估的是竞品。它用的两套基准里,Binary Exploitation 是内部基准。它的结论方向,与它的政策主张完全一致。它主张政府应该对足够强的模型强制安全测试。同时主张扩大防守方对前沿模型的访问。这两条都与它的利益同向。

但这是竞争对手做的评估,不是独立审计——这不影响数据本身,但影响你该怎么用它。

还有一处时间线上的细节值得留意。Anthropic 的文章 9 月 29 日发出。它确实引用了 NIST 的评估,也提到了「落后约四个月」。

同一天,Anthropic CEO 达里奥·阿莫代伊正在白宫与特朗普一起,和另外五家美国 AI 公司的高管签署一份自我监管承诺。两天前,特朗普刚与他在白宫共进私人晚餐。这家公司一边主张政府对足够强的模型强制安全测试,一边在同一天签下了「行业自己管自己」的协定。

同一天发生可能是巧合;文章和那场会面有没有因果关系,。当天注意到这个时间巧合的是西班牙语区 AI 科普博主 @DotCSV。他还指出,夸大开源模型的能力、把它抬到私有模型的水平本就是常见操作,罕见的是这次出手的就是 Anthropic 自己。

更能说明问题的是文章自己透露的细节。Anthropic 的研究员,用 GLM-5.3 挖出了浏览器 0-day。这项工作,是防守方要做的活。安全研究员 Andrew Case(@attrc)的原话是:「我非常困惑,为什么 Anthropic 要写一篇博客,替安全团队宣传应该换用 GLM!?」

这句话点到了一个真实矛盾。护栏在攻击和防守之间不做区分。

2026 年 7 月一起 AI agent 逃逸事件中,响应团队需要拆解上万条动作记录。先试的模型大面积拒答。团队最终改用自托管的中文开放权重模型,才完成了解码工作。这条线索只有行业媒体转述,没有一手原文。

如果这条成立,含义比「护栏可绕」更深。护栏的误杀率,也在把专业用户推向开放权重。Anthropic 自己就在主张给防守方更多前沿模型访问权,说明它知道这个问题。但它的解法是扩大白名单,不是降低误杀。这一点,比护栏本身更值得接下来观察。

几小时后还有一条更直白的帖子。@no_stp_on_snek 写道:「看完 Anthropic 这篇文章,我重新下载了 GLM 5.3,之前为了腾空间删掉过。」从上面那条「不敢相信」到这条,只隔了五个多小时。一份警告最直接的产出,是一次反向下载。


七、常见问题

Q:GLM-5.3 真的比美国前沿模型强吗?

不是。CAISI 的独立评估显示它落后约四个月,四项基准的置信区间都不重叠。但相比上一代中国开放权重模型,它确实有明显跃升。

Q:Anthropic 说的可信吗?

它给出的案例和测试口径都可核实,其中一个基准还是公开基准。但它同时是竞品和政策主张方,结论需要第三方复现。

Q:这两份评估有没有可能出错?

有可能。Anthropic 自己承认,模拟测试环境无法真实执行代码,它还把「模型尝试连接远程目标」和「实际入侵成功」分开表述。CAISI 则在方法论说明里给出了置信区间。两份文件都留了修正空间,这反而比单纯的厂商宣传更可信。

Q:发布当天的白宫会面,和这篇文章有关系吗?

时间上重合是事实:文章 9 月 29 日发出,Anthropic CEO 同日在白宫签署行业自我监管协定,两天前还刚与特朗普共进晚餐。但「因此才发」是外界推断,没有一手信息能证明因果。可以确定的是,这两件事的方向并不一致。

Q:「开源最强」这个说法准确吗?

准确,但限定在两个范围内:网络能力,开放权重。而且这句话出自 NIST 的 CAISI,不是 Anthropic。

Q:护栏真的没用吗?

不是。裸指令下模型拒答率是 100%。问题在于绕过的成本很低,尤其是权重可下载这一点,没法靠升级 API 修复。

Q:普通企业需要做什么?

先把补丁窗口的假设改掉。一条公开漏洞的利用链成本已经降到两位数美元,从披露日到武器化的时间就不再是安全边界。

Q:这件事和开放权重该不该开放有关吗?

有关。同一周,智谱与安全机构 Concordia AI 提出了开放权重的分阶段发布框架,并把 GLM-5.3 自己延后两周放出权重作为范例。这与 Anthropic 的呼吁方向部分重合。


参考来源

  1. GLM-5.3 and the spread of advanced cyber capabilities / Anthropic Frontier Red Team / https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

  2. CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities / NIST CAISI / https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities

  3. Anthropic: Zhipu’s GLM-5.3 Matches Claude on Autonomous Exploits / AI Weekly / https://aiweekly.co/alerts/anthropic-zhipus-glm-53-matches-claude-on-autonomous-exploits

  4. Anthropic: open-weights GLM-5.3 nearly matches Claude Mythos Preview at building exploits / ArtificialWatch / https://artificialwatch.com/wire/glm-5-3-cyber-anthropic

  5. Anthropic finds a Chinese open-weight model can build working cyber exploits / It Does What Now? / https://itdoeswhatnow.com/m/2026-09-29-anthropic-finds-a-chinese-open-model-can-build-working-cyber-exploits

  6. Anthropic reports GLM-5.3 built browser exploits in 50 of 410 attempts / AI Primer / https://www.ai-primer.com/engineer/stories/glm-53-exploit-tests

  7. Free Chinese AI ‘matches’ US rivals at finding flaws on one narrow test / PK Sharma Briefing / https://www.pk-sharma.com/briefing/chinese-open-weight-models-bug-finding-match-claim

  8. China is catching up / CEO.com / https://www.ceo.com/blog/china-is-catching-up

  9. Anthropic 一篇警告文,将 GLM-5.3 写成了「最强安全工具」/ 网易 / https://www.163.com/dy/article/L82IF6M40511D6RL.html

  10. CAISI’s Evaluation Cadence for Open-Weight and PRC-Origin AI Models / CASRAI / https://casrai.org/guides/caisi-open-weight-model-cyber-assessments

  11. “I am very confused why Anthropic wrote a blog post advertising for cybersecurity teams to switch to GLM!?!?” / Andrew Case(@attrc)/ https://x.com/attrc/status/2105033855547613482

  12. “I can’t believe Anthropic posted this… the model Anthropic kept locked away for safety. Except this one you can just download.” / Hassan(@buildwithhassan)/ https://x.com/buildwithhassan/status/2104998096396550222

  13. Sobre inflar las capacidades de modelos opensource(Es habitual ver cómo en ocasiones se inflan las capacidades…)/ Carlos Santana(@DotCSV)/ https://x.com/DotCSV/status/2105073641792614412

  14. “Im redownloading GLM 5.3 after the anthropic article.” / Tom Turney(@no_stp_on_snek)/ https://x.com/no_stp_on_snek/status/2105077025551618082

  15. Tech leaders, Trump sign new ‘self-policing’ AI accord / USA TODAY / https://www.usatoday.com/story/news/politics/2026/09/29/trump-official-rebranding-ai-to-super-intelligence/92003107007

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询