GLM-5.3的网络安全能力有多强?CyberGym 84.5分背后的开源SOTA漏洞发现
2026/9/20 10:08:39 网站建设 项目流程

GLM-5.3的网络安全能力有多强?CyberGym 84.5分背后的开源SOTA漏洞发现

【免费下载链接】GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。项目地址: https://ai.gitcode.com/zai-org/GLM-5.3

GLM-5.3是智谱AI开源的大语言模型,与 GLM-5.2 共用同一基座,所有提升均来自后训练。它在复杂编程和长程任务上表现显著提升,其中网络安全(Cyber)能力尤为突出——在CyberGym漏洞发现基准上拿下84.5 分,位列开源模型 SOTA;在利用链(Exploitation)基准上更是将前代能力翻倍,展现出"涌现式"安全攻防能力。


🎯 一句话看懂 GLM-5.3 的定位

同一个基座模型 → 更深的后训练 → 编程更强 +网络安全能力大幅涌现

GLM-5.3 不是靠"换个底座"实现的提升,而是通过更大规模的后训练(Post-training),让模型在漏洞发现、利用链构建、终端自动化三个维度同时跃升。


📊 CyberGym 84.5:漏洞发现开源第一

CyberGym是衡量模型**漏洞发现(Vulnerability Discovery)**能力的核心基准,共 1,507 个任务。GLM-5.3 的评测条件非常严苛:

评测细节说明
任务数量1,507 个真实漏洞场景
推理努力max(最高)
超时限制每任务无上限
网络访问关闭,仅允许 pypi.org 等必要域名
Git 信息全部移除,防止"抄答案"
结果口径单次运行 Pass@1

与主流模型对比

模型CyberGym排名
GLM-5.384.5🥇 开源 SOTA
GPT-5.6 Sol83.6🥈
Fable 583.8🥉
DeepSeek-V4 Pro-081383.34
GLM-5.277.2

GLM-5.3 相比 GLM-5.2 提升+7.3 分,且领先第二名近 1 分,是开源权重模型中漏洞发现能力的天花板


⚔️ 利用链能力:GLM-5.2 的 3 倍以上

如果说"发现漏洞"是上半场,那"构建利用链(Exploit Chain)"才是下半场。GLM-5.3 在后训练规模扩大后,利用链能力增长远超预期

ExploitGym:869 个利用任务

模型2小时6小时
GLM-5.3105130
GLM-5.22939
Kimi K33670
Qwen3.8 Max1426
  • 2小时窗口内,GLM-5.3 是 GLM-5.2 的3.6 倍
  • 6小时窗口内,GLM-5.3 是 GLM-5.2 的3.3 倍
  • 是 Qwen3.8 Max 的7.5 倍(2h)

ExploitBench:41 个任务 × 3 轮覆盖

模型ExploitBench
GLM-5.354.4
GLM-5.224.4
Fable 578.0
Opus 4.840.0

GLM-5.3 相比 GLM-5.2翻倍还多(+123%),在开源模型中仅次于 Fable 5。


🧠 为什么后训练能带来安全能力的"涌现"?

README 原文用了一个关键词:Emergent Cyber Capability(涌现式网络安全能力)。

后训练规模扩大 │ ├──→ 复杂编程能力 ↑(Z.ai Code Bench +50%) ├──→ 长程任务能力 ↑(Terminal Bench 3.0: 4.6 → 28.3) └──→ 网络安全能力 ↑↑↑(CyberGym 77.2 → 84.5) └── 利用链能力增长最快(ExploitGym ×3.6)

背后的逻辑:

  1. 编程与安全的深度耦合:漏洞发现本质上是"读懂代码 + 理解系统 + 推理边界",这三项能力在编程后训练中同步强化。
  2. 长程推理是关键:利用链构建需要多步骤、多轮工具调用,GLM-5.3 的1M token 上下文(config.json 中max_position_embeddings: 1048576)让它能在单次会话中追踪完整的攻击链路。
  3. 工具调用模板成熟:chat_template.jinja 中内置了完整的<tool_call>/<tool_response>协议,模型在评测中可以直接操作终端、执行命令、读写文件,而无需外部"胶水代码"。

🔧 模型规格速览

参数来源
架构GlmMoeDsaForCausalLM(MoE + DSA)config.json
层数78 层config.json
路由专家256 个(每 token 激活 8 个)+ 1 共享专家config.json
隐藏维度6,144config.json
上下文长度1,048,576 tokens(1M)config.json
词表大小154,880config.json
量化FP8(e4m3)config.json
精度bfloat16config.json
推理努力控制reasoning_effort: low / high / max(默认 max)README.md
生成默认参数temperature=1.0, top_p=0.95generation_config.json

权重文件共141 个 safetensors 分片,配合 model.safetensors.index.json 可完整加载。


🚀 本地部署 GLM-5.3 的 6 条路径

GLM-5.3 官方支持以下推理框架(来自 README.md):

框架适用场景
SGLang高吞吐在线服务
vLLM生产级推理服务
TokenSpeed低延迟推理
Transformers快速验证 / 研究
KTransformersCPU+GPU 混合推理(低显存)
Unsloth高效微调 / 量化部署
Ascend NPU华为昇腾平台(vLLM-Ascend / xLLM / SGLang)

💡提示:用于安全评测/基准复现时,保持reasoning_effort=max(默认值);日常对话场景建议传入clear_thinking=true以节省输出 token。


📋 其他关键基准成绩

网络安全之外,GLM-5.3 在通用编程和智能体基准上同样领先:

基准GLM-5.3GLM-5.2提升幅度
Terminal Bench 2.188.281.0+7.2
Terminal Bench 3.028.34.6+23.7
DeepSWE (v1.1)66.946.2+20.7
SWE-Marathon (v1.1)42.519.4+23.1
AutomationBench48.226.2+22.0
GDPval-AA v217691508+261

Terminal Bench 3.0 从 4.6 → 28.3 的跃升尤其值得关注——这意味着 GLM-5.3 在隔离容器内自主完成复杂终端任务的能力有了质变,而这正是安全攻防场景的核心能力。


❓ 常见问题

Q:GLM-5.3 的 CyberGym 84.5 是怎么算的?A:在 1,507 个漏洞发现任务上,单次运行(Pass@1)通过率。评测中模型被放在任务容器内,无网络访问(仅 pypi/deb 白名单),无 Git 信息,模拟真实攻防环境。详见 README.md Footnotes。

Q:为什么 GLM-5.3 不用新底座就能大幅提升?A:后训练(Post-training)规模扩大是核心。README 明确写道:"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training." 更大的后训练让编程、长程推理和安全攻防能力同步涌现。

Q:部署需要多少显存?A:模型采用 FP8 量化 + MoE 架构(256 专家每 token 只激活 8 个),实际激活参数远小于总参数。具体显存需求取决于选择的推理框架和量化方案,KTransformers 框架特别适合低显存 CPU+GPU 混合场景。

Q:如何引用 GLM-5.3?A:技术报告 arXiv 编号为2602.15763,完整 BibTeX 见 README.md 的 Citation 部分。


📁 仓库文件索引

文件说明
README.md项目主页:基准成绩、部署指南、评测细节
config.json模型架构配置(78层MoE、1M上下文、FP8)
generation_config.json默认生成参数(temperature=1.0, top_p=0.95)
tokenizer_config.jsonTokenizer 配置(1M 最大长度)
chat_template.jinja对话模板(含工具调用协议、reasoning_effort 控制)
model.safetensors.index.json权重索引(141 个分片)
model-00001-of-00141.safetensors ~ model-00141-of-00141.safetensors模型权重文件
LICENSE开源协议

🏁 总结

GLM-5.3 用同一个基座证明了:后训练的深度决定了模型能力的上限

在网络安全这个维度,它不是"略胜一筹",而是:

  • 漏洞发现(CyberGym):开源SOTA 84.5 分
  • 利用链构建(ExploitGym):前代3.6 倍
  • 漏洞利用覆盖(ExploitBench):前代2.2 倍

对于安全研究员、红队测试工程师或任何想用开源模型做自动化安全扫描的团队来说,GLM-5.3 目前是免费可部署的最强选择

【免费下载链接】GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。项目地址: https://ai.gitcode.com/zai-org/GLM-5.3

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询