☰
Beam 拆解:501B 只激活 23B,一亿次 rollout 和 13 亿沙箱堆出的开源权重
2026/10/7 7:50:30 网站建设 项目流程

10 月 5 日,Reflection 发布首款开源权重模型 Beam:501B 总参数,激活仅 23B。

发布页面上没有权重下载链接,只有一个 early access 的邮箱登记框。

HN 热榜评论区的高赞声音很直接:把权重放出来,否则别自称开放。

争议归争议,这份技术博客里的工程数字密度,是今年开源发布里少见的。

一万零五百块 GB300 连跑四周,生成超过一亿次 rollout,动用约十三亿个沙箱。

这组数字指向一个判断:前沿 RL 的竞争已滑出算法论文,落进分布式系统工程。

本文按四条线拆这次发布:跑分站位、推理成本账、RL 工程栈、发布策略。

跑分只是入场券,真正值得核验的是它如何把一百万个 RL 环境跑成流水线。

Beam 是稀疏 MoE 架构,主打编码、推理与智能体负载,权重本月以 Apache 2.0 放出。

在权重落地前所有结论都标注来源:跑分引官方博客,质疑引 HN 原帖。

一、跑分表只是入场券:与 GLM-5.2 贴身、离 Kimi K3 还差一截

官方给出的对照组有七个,覆盖 Inkling、Nemotron 3 Ultra 到 DeepSeek V4.1 Flash。

DeepSWE v1.1 上 Beam 拿 44.4,恰好压在 GLM 5.2 的 44.0 上方零点四分。

基准BeamGLM 5.2GLM 5.3Kimi K3Qwen 3.8-MaxDS V4.1 Flash
DeepSWE v1.144.444.061.068.051.074.2
SWE-Bench Pro v2-Hard77.2NR84.388.2NRNR
SWE-Bench Pro v165.562.1NRNR67.7NR
Terminal Bench 2.180.181.088.288.386.690.6
SWE-bench Verified80.9NRNRNRNRNR
SWE-bench Multilingual78.0NRNRNRNRNR

同一项 DeepSWE 上 GLM 5.3 是 61.0,Kimi K3 是 68.0,头部阵营的分差并不小。

Terminal Bench 2.1 上 Beam 拿 80.1,比 GLM 5.2 的 81.0 还低将近一分。

SWE-Bench Pro v2-Hard 是它最好看的一行,77.2 对 Inkling 的 56.9 拉开二十分。

SWE-bench Verified 拿到 80.9,多语言版本拿到 78.0,均属已报告阵营的高位。

SWE Atlas 代码库问答只有 34.6,对照组里 GLM 5.3 是 61.0,这一行明显掉队。

官方定性很克制:与 GLM 5.2 持平、逼近 Qwen 3.8-Max,原始能力落后 Kimi K3。

HN 网友的直白翻译是:它在跟 GLM 上一代打平,而 GLM 5.3 Flash 更小更快。

把这表读成超越开源前沿是过度解读,读成西方开源阵营重回牌桌更准确。

注意表里大量 NR 空格,七个对照组在七项基准上的报告口径并不完整。

缺报集中在 GLM 5.2 的新版基准与 Qwen 3.8-Max 的多数行,横比时要打折。

官方注明别家分数引自 Artificial Analysis 与 DataCurve,并非同一 harness 重跑。

这意味着表内数字混着不同评测环境,分差两三分以内的行不宜下硬结论。

真正站得住的事实只有两个:它和 GLM 5.2 同档,且激活参数只有 23B。

同档能力配更低激活参数,才是这次发布的真正卖点——推理侧的成本账。

二、推理账本:用 23B 激活参数换 3 到 4 倍算力差

Beam 对推理效率的声明很具体:高级推理基准打平 GLM 5.2,算力少 3 到 4 倍。

它给出的估算公式是 FLOPs 约等于 2 乘激活参数乘平均生成 token 数。

这个口径只算生成阶段的前向传播,把每次乘加计为两次浮点运算。

MoE 模型按每 token 实际激活的参数量代入,而不是拿总参数充数。

生成 token 数把推理链和最终答案一起计入,长推理的成本被如实放大。

口径同时排除了预填充、注意力运算和服务开销,官方自述是近似而非实测。

排除项恰恰是企业落地的大头,长上下文场景的预填充成本不在公式里。

对 2T 以上参数家族如 Qwen 3.8-Max,它声称优势更明显,但未给具体倍数。

HN 网友整理的对照表显示:DeepSeek V4.1 Flash 总参 552B,预填充只激活 8B。

同一对照里 Beam 预填充与解码都激活 23B,也没有 n-gram 外置参数层。

也就是说 Beam 的省算力是相对 GLM 5.2 这一代,而非相对所有稀疏架构。

DeepSeek 系靠 n-gram 参数外置把知识搬进廉价存储,Beam 没走这条路。

有 HN 用户直接提问:新模型为什么都不用 n-gram,这是低成本扩知识的现成方案。

官方博客对此没有回答,架构细节要等本月的技术报告才能验证。

可控长度惩罚是效率故事的另一半:奖励正确解,同时惩罚多余 token。

RL 早期出现罕见组合:完成长度在下降,任务成功率反而在上升。

到训练中后段智能体能力增强,长度重新增长,但新增 token 换来了对应分数。

官方把这条曲线称为帕累托前沿的两阶段运动,先向内收缩再向外扩张。

用户侧拿到的是 reasoning effort 参数,低档省 token,高档换难题表现。

对按 token 计费的企业部署,这个旋钮比跑分表上的零点四分值钱得多。

三、一亿次 rollout:RL 被跑成一场分布式系统工程

RL 是 Beam 的核心扩增轴,官方把算法、环境和基础设施列为同等级投入。

硬件底座是 10,500 块 NVIDIA GB300,连续跑了四个星期。

产出是超过一亿次 rollout,单次 rollout 的上下文上限放到 256K token。

仅推理专家一个组件就消耗其中八千万次,而 Inkling 整个训练只用三千万次。

小米 MiMo 公开的 RL 规模是七十五万三千次 rollout,量级差了两位以上。

官方称这是开放实验室迄今最大规模 RL 运行之一,限定词用得谨慎。

支撑这一亿次尝试的是近一百万个环境,主体来自合成数据流水线。

其余环境来自专有供应商数据与开源来源,三条渠道按统一标准过滤。

难度过滤的标准是不能次次做对、也不能次次做不对,两端都喂不出梯度信号。

质量过滤排除表述欠定、误导、可猜测、可钻空子和带噪声的任务。

过滤不是一次性的:任务先经 RL 实测,暴露的问题回流到下一轮采集。

官方坦承数据质量妥协会直接造成能力平台期,质量迭代是上涨的前提。

整个运行结束时评估曲线没有饱和迹象,言下之意是算力加码仍有收益。

平台侧持续维持的平均并发是十一万次 rollout 同时进行。

推理与训练的 GPU 配比在 3.9 比 1 到 5.4 比 1 之间随负载动态调整。

训练器在同一训练血缘内切换过五种 GPU 网格配置,且没有丢失训练状态。

新权重抵达推理集群的中位耗时约十二秒。

分层分发先跨机架走 RoCE 网络,再在机架内经 NVLink 本地共享。

相比每个副本独立拉取,这套方案把跨机架流量降低百分之七十五。

全集群采纳同一版新权重的速度因此快了 2.2 倍。

四周内平台处理了七十一起推理故障,训练任务一次都没有因此终止。

推理容量恢复的中位时间是八分钟。

故障损失的容量只占已服务 GPU 分钟的万分之二。

沙箱层的峰值并发是十七万个实例同时存活。

全周期累计处理超过十亿次沙箱创建请求。

这些请求横跨二十个集群、两家云厂商和四个地理区域。

百分之九十的新沙箱在十秒内完成就绪。

动态打包把训练批次的平均填充率维持在 99.99%。

平均 rollout 长度在周期内上涨近七成,单卡训练吞吐波动压在 1.5% 以内。

训练与打分合计的沙箱总用量约十三亿个,此前没有实验室公开过这个量级。

四、样本落后 107 个版本还能学:全异步 RL 的稳定性从哪来

全异步意味着 rollout 由不同版本的 checkpoint 混合生成,轨迹越长跨版本越多。

早生成的 token 相对当前策略越来越陈旧,这是异步方法失稳的头号来源。

训练引擎与推理引擎之间的数值误差,会进一步放大这种陈旧。

Beam 的做法是给每个 token 打上产生它的权重版本号,让算法显式感知陈旧度。

官方声称新算法让系统能从一天前生成的交互中稳定学习。

最极端的展示是批量中最老样本落后当前策略 107 个权重版本,数值仍不发散。

可回放的奖励记录让奖励如何进入训练全程可审计。

独立判分器会二次筛查通过样本,专门清理钻评分器漏洞的投机解。

逐 token 记录还支撑训练与推理两侧的数值一致性校验,每一步都可比对。

这套设计的含义是:稳定性不靠更大的 batch 硬扛,而是靠可测量换来。

下面这段 Python 用纯标准库实现陈旧度感知修正的核心机制,可直接运行。

它模拟新旧两个策略分布,对陈旧样本做重要性截断,观察估计偏差的变化。

import math, random def softmax(logits): m = max(logits) e = [math.exp(x - m) for x in logits] s = sum(e) return [v / s for v in e] V = 8 random.seed(42) new_logits = [random.gauss(0, 1) for _ in range(V)] base_old = [x + random.gauss(0, 0.6) for x in new_logits] new_p = softmax(new_logits) true_value = sum(i * new_p[i] for i in range(V)) def sample_index(p): r = random.random() acc = 0.0 for i, v in enumerate(p): acc += v if r <= acc: return i return V - 1 def estimate(staleness, n=4000, clip=2.0): drift = [x + random.gauss(0, 0.15 * staleness ** 0.5) for x in base_old] beh = softmax(drift) # 行为策略随陈旧度漂移 naive, corrected = [], [] for _ in range(n): tok = sample_index(beh) r = new_p[tok] / max(beh[tok], 1e-12) naive.append(tok * r) corrected.append(tok * min(r, clip)) # 截断抑制方差 return sum(naive) / n, sum(corrected) / n print(f"target mean = {true_value:.4f}") for stale in (1, 8, 107): raw, fixed = estimate(stale) print(f"stale={stale:>3} naive={raw:.4f} clipped={fixed:.4f}")

输出显示陈旧度升高时未修正估计的偏差显著放大,截断后收敛回目标附近。

有效样本量随陈旧度上升而下降,这正是 Beam 必须维持高速权重分发的原因。

权重下发每慢一秒,批量里的平均陈旧度就抬高一分,有效样本量就缩水一分。

把这个关系和十二秒的中位下发时间放在一起看,工程指标与算法稳定是同一笔账。

HN 上有工程师留言想看这种规模训练的运维日志,因为 GPU 故障是常态输入。

万卡集群里随时有节点掉线,能带病续训的系统设计本身就是研究壁垒。

五、预训练底座:95% 淘汰率与被打捞的 1.8 万亿 token

RL 的前提是一个足够强的底座,Beam Base 用 6,144 块 GB300 NVL72 训练。

端到端预训练用时不到四周,损失曲线全程没有不可恢复的大幅尖刺。

预训练数据是 23.8 万亿 token,来自公开网页、公共来源与专有授权数据。

数据管线先经解析、去重与清洗,约百分之九十五的原始互联网 token 被淘汰。

自训质量分类器按网页、代码和 STEM 三个域分别打分,分桶到细粒度质量层级。

官方给出的反直觉数字是:传统开源过滤框架会漏掉约 1.8 万亿高质量 token。

被打捞回来的部分包括百分之八十七的精选网页代码 token。

代码数据按语言单独调过滤器,剔除低质自动生成与不可学习的内容。

另有分类器专门识别损坏代码,因为这类样本会直接伤害训练稳定性。

占比过高的语言与文件类型会被再平衡,防止模型的接触面收窄。

PDF 管线用视觉语言 OCR 模型加自研质量分类器,分布式跑在数千块 GPU 上。

这条管线处理 PB 级技术文档,负责把 STEM 知识灌进底座。

高价值代码与技术内容在周期内被重复多次,配合模糊去重控制收益递减。

架构稳定性设计包括局部与全局注意力交替、细粒度路由专家和受控残差流。

负载均衡沿用 DeepSeek 的无辅助损失方案,叠加专家偏置更新的余弦衰减。

序列级均衡让模型在预训练分布之外的数据上也维持专家利用均匀。

训练结束时最忙专家的负载仅为平均值的 1.04 倍,接近完美均匀。

残差流用按深度缩放加 SandwichNorm、逐元素注意力门控和 FP32 累加控制数值。

全部五十二层的残差 RMS 全程有界,没有出现持续的激活增长。

整个运行只执行九次半自动回卷,末期 goodput 达到 92.3%。

六、安全对齐:双教师蒸馏与可以被预测的奖励

对齐采用双教师结构:一个大规模 RL 教师,一个专职安全与对齐教师。

两位教师的能力经多教师同策略蒸馏合并进最终模型,官方缩写为 MOPD。

安全原则分三层:不可违反的规则、应始终满足的品质、默认交互风格。

第二层包括利用给定上下文、做准确声明、承认不确定性、透明执行用户要求。

安全训练采用审议式对齐,把安全策略直接写进模型的推理过程。

数据集按对抗迭代构建:训一轮模型,生成能诱发违规的提示,再折回下一轮。

安全 RL 的场景覆盖单轮、多轮、越狱和施压工具调用四类。

目标是同时压低过度拒绝与有害顺从,这两个指标通常此消彼长。

大量对齐环境是不可验证奖励,由生成式奖励模型当裁判。

官方声称能在跑 RL 之前预测奖励带来的行为变化,相关系数 0.79。

作为对照,仅用 Best-of-N 上限做预测的相关系数只有 0.46。

可预测性让团队在训练前迭代评分标准,定点压制幻觉与过度格式化。

安全评测结果将随技术报告发布,内部安全评测套件承诺开源。

可检验的开源安全标准如果真落地,会是这次发布里被低估的一项资产。

七、权重未到先开发布会:一场精心计算的生态卡位

这次发布最大的争议不是技术,而是没有权重的开源权重模型发布。

HN 的高赞评论把它类比为空开:宣称开放却不放出实际产品。

更尖锐的质疑指向融资动机:在收购窗口期前用发布抬高身价。

也有网友给出截止日推演:承诺本月放权重,期限就是十月三十一日。

官方的时间线是红队测试与评估收尾,本月放出权重、报告、模型卡与开发件。

放出的不只是权重,还有运行、评测与微调全栈,以及一批分发伙伴。

泛化实验的插曲更值得记录:官方称 180×90 经纬网格谜题上线仅数日。

官方用训练数据来不及收录,论证 Beam 的 95.5% 覆盖率属于真泛化。

HN 用户当天就挖出同类实验今年八月已出现在 LessWrong。

用谜题很新证明泛化的论证链因此断了一环,95.5% 仍在但含义变了。

这个插曲的教训是:凡以数据新鲜度论证泛化,必须先做收录可能性审计。

Beam 的 95.5% 介于 Opus 5 的 92.5% 与 Fable 5 的 97.8% 之间,排位并不差。

Reflection 的底色解释了发布节奏:融资超四十亿美元,估值约二百五十亿。

这家公司在完全隐身状态下运营至今,Beam 是它第一个公开模型。

有评论认为正确节奏是 Qwen 路径:先在别人的权重上做后训练证明有用。

Reflection 选了相反的重资产路径:先自建万卡预训练,再一次性摊牌。

两条路径没有对错,但重资产路径的每一步都必须经得起复算。

一个务实提醒来自 HN:权重落地后的固定 harness、断网复测才是真考试。

在此之前,Beam 对行业的真实贡献是这份公开的 RL 工程清单本身。

如果月底权重如期以 Apache 2.0 放出,西方开源阵营才算真正回到牌桌。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询