GLM-5.3的网络安全能力有多强?CyberGym 84.5分背后的开源SOTA漏洞发现
【免费下载链接】GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。项目地址: https://ai.gitcode.com/zai-org/GLM-5.3
GLM-5.3是智谱AI开源的大语言模型,与 GLM-5.2 共用同一基座,所有提升均来自后训练。它在复杂编程和长程任务上表现显著提升,其中网络安全(Cyber)能力尤为突出——在CyberGym漏洞发现基准上拿下84.5 分,位列开源模型 SOTA;在利用链(Exploitation)基准上更是将前代能力翻倍,展现出"涌现式"安全攻防能力。
🎯 一句话看懂 GLM-5.3 的定位
同一个基座模型 → 更深的后训练 → 编程更强 +网络安全能力大幅涌现
GLM-5.3 不是靠"换个底座"实现的提升,而是通过更大规模的后训练(Post-training),让模型在漏洞发现、利用链构建、终端自动化三个维度同时跃升。
📊 CyberGym 84.5:漏洞发现开源第一
CyberGym是衡量模型**漏洞发现(Vulnerability Discovery)**能力的核心基准,共 1,507 个任务。GLM-5.3 的评测条件非常严苛:
| 评测细节 | 说明 |
|---|---|
| 任务数量 | 1,507 个真实漏洞场景 |
| 推理努力 | max(最高) |
| 超时限制 | 每任务无上限 |
| 网络访问 | 关闭,仅允许 pypi.org 等必要域名 |
| Git 信息 | 全部移除,防止"抄答案" |
| 结果口径 | 单次运行 Pass@1 |
与主流模型对比
| 模型 | CyberGym | 排名 |
|---|---|---|
| GLM-5.3 | 84.5 | 🥇 开源 SOTA |
| GPT-5.6 Sol | 83.6 | 🥈 |
| Fable 5 | 83.8 | 🥉 |
| DeepSeek-V4 Pro-0813 | 83.3 | 4 |
| GLM-5.2 | 77.2 | — |
GLM-5.3 相比 GLM-5.2 提升+7.3 分,且领先第二名近 1 分,是开源权重模型中漏洞发现能力的天花板。
⚔️ 利用链能力:GLM-5.2 的 3 倍以上
如果说"发现漏洞"是上半场,那"构建利用链(Exploit Chain)"才是下半场。GLM-5.3 在后训练规模扩大后,利用链能力增长远超预期。
ExploitGym:869 个利用任务
| 模型 | 2小时 | 6小时 |
|---|---|---|
| GLM-5.3 | 105 | 130 |
| GLM-5.2 | 29 | 39 |
| Kimi K3 | 36 | 70 |
| Qwen3.8 Max | 14 | 26 |
- 2小时窗口内,GLM-5.3 是 GLM-5.2 的3.6 倍
- 6小时窗口内,GLM-5.3 是 GLM-5.2 的3.3 倍
- 是 Qwen3.8 Max 的7.5 倍(2h)
ExploitBench:41 个任务 × 3 轮覆盖
| 模型 | ExploitBench |
|---|---|
| GLM-5.3 | 54.4 |
| GLM-5.2 | 24.4 |
| Fable 5 | 78.0 |
| Opus 4.8 | 40.0 |
GLM-5.3 相比 GLM-5.2翻倍还多(+123%),在开源模型中仅次于 Fable 5。
🧠 为什么后训练能带来安全能力的"涌现"?
README 原文用了一个关键词:Emergent Cyber Capability(涌现式网络安全能力)。
后训练规模扩大 │ ├──→ 复杂编程能力 ↑(Z.ai Code Bench +50%) ├──→ 长程任务能力 ↑(Terminal Bench 3.0: 4.6 → 28.3) └──→ 网络安全能力 ↑↑↑(CyberGym 77.2 → 84.5) └── 利用链能力增长最快(ExploitGym ×3.6)背后的逻辑:
- 编程与安全的深度耦合:漏洞发现本质上是"读懂代码 + 理解系统 + 推理边界",这三项能力在编程后训练中同步强化。
- 长程推理是关键:利用链构建需要多步骤、多轮工具调用,GLM-5.3 的1M token 上下文(config.json 中
max_position_embeddings: 1048576)让它能在单次会话中追踪完整的攻击链路。 - 工具调用模板成熟:chat_template.jinja 中内置了完整的
<tool_call>/<tool_response>协议,模型在评测中可以直接操作终端、执行命令、读写文件,而无需外部"胶水代码"。
🔧 模型规格速览
| 参数 | 值 | 来源 |
|---|---|---|
| 架构 | GlmMoeDsaForCausalLM(MoE + DSA) | config.json |
| 层数 | 78 层 | config.json |
| 路由专家 | 256 个(每 token 激活 8 个)+ 1 共享专家 | config.json |
| 隐藏维度 | 6,144 | config.json |
| 上下文长度 | 1,048,576 tokens(1M) | config.json |
| 词表大小 | 154,880 | config.json |
| 量化 | FP8(e4m3) | config.json |
| 精度 | bfloat16 | config.json |
| 推理努力控制 | reasoning_effort: low / high / max(默认 max) | README.md |
| 生成默认参数 | temperature=1.0, top_p=0.95 | generation_config.json |
权重文件共141 个 safetensors 分片,配合 model.safetensors.index.json 可完整加载。
🚀 本地部署 GLM-5.3 的 6 条路径
GLM-5.3 官方支持以下推理框架(来自 README.md):
| 框架 | 适用场景 |
|---|---|
| SGLang | 高吞吐在线服务 |
| vLLM | 生产级推理服务 |
| TokenSpeed | 低延迟推理 |
| Transformers | 快速验证 / 研究 |
| KTransformers | CPU+GPU 混合推理(低显存) |
| Unsloth | 高效微调 / 量化部署 |
| Ascend NPU | 华为昇腾平台(vLLM-Ascend / xLLM / SGLang) |
💡提示:用于安全评测/基准复现时,保持
reasoning_effort=max(默认值);日常对话场景建议传入clear_thinking=true以节省输出 token。
📋 其他关键基准成绩
网络安全之外,GLM-5.3 在通用编程和智能体基准上同样领先:
| 基准 | GLM-5.3 | GLM-5.2 | 提升幅度 |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | +7.2 |
| Terminal Bench 3.0 | 28.3 | 4.6 | +23.7 |
| DeepSWE (v1.1) | 66.9 | 46.2 | +20.7 |
| SWE-Marathon (v1.1) | 42.5 | 19.4 | +23.1 |
| AutomationBench | 48.2 | 26.2 | +22.0 |
| GDPval-AA v2 | 1769 | 1508 | +261 |
Terminal Bench 3.0 从 4.6 → 28.3 的跃升尤其值得关注——这意味着 GLM-5.3 在隔离容器内自主完成复杂终端任务的能力有了质变,而这正是安全攻防场景的核心能力。
❓ 常见问题
Q:GLM-5.3 的 CyberGym 84.5 是怎么算的?A:在 1,507 个漏洞发现任务上,单次运行(Pass@1)通过率。评测中模型被放在任务容器内,无网络访问(仅 pypi/deb 白名单),无 Git 信息,模拟真实攻防环境。详见 README.md Footnotes。
Q:为什么 GLM-5.3 不用新底座就能大幅提升?A:后训练(Post-training)规模扩大是核心。README 明确写道:"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training." 更大的后训练让编程、长程推理和安全攻防能力同步涌现。
Q:部署需要多少显存?A:模型采用 FP8 量化 + MoE 架构(256 专家每 token 只激活 8 个),实际激活参数远小于总参数。具体显存需求取决于选择的推理框架和量化方案,KTransformers 框架特别适合低显存 CPU+GPU 混合场景。
Q:如何引用 GLM-5.3?A:技术报告 arXiv 编号为2602.15763,完整 BibTeX 见 README.md 的 Citation 部分。
📁 仓库文件索引
| 文件 | 说明 |
|---|---|
| README.md | 项目主页:基准成绩、部署指南、评测细节 |
| config.json | 模型架构配置(78层MoE、1M上下文、FP8) |
| generation_config.json | 默认生成参数(temperature=1.0, top_p=0.95) |
| tokenizer_config.json | Tokenizer 配置(1M 最大长度) |
| chat_template.jinja | 对话模板(含工具调用协议、reasoning_effort 控制) |
| model.safetensors.index.json | 权重索引(141 个分片) |
| model-00001-of-00141.safetensors ~ model-00141-of-00141.safetensors | 模型权重文件 |
| LICENSE | 开源协议 |
🏁 总结
GLM-5.3 用同一个基座证明了:后训练的深度决定了模型能力的上限。
在网络安全这个维度,它不是"略胜一筹",而是:
- 漏洞发现(CyberGym):开源SOTA 84.5 分
- 利用链构建(ExploitGym):前代3.6 倍
- 漏洞利用覆盖(ExploitBench):前代2.2 倍
对于安全研究员、红队测试工程师或任何想用开源模型做自动化安全扫描的团队来说,GLM-5.3 目前是免费可部署的最强选择。
【免费下载链接】GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。项目地址: https://ai.gitcode.com/zai-org/GLM-5.3
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考