note
- 动机:OPD 已成为后训练常用方法,但一个强 teacher 为什么有时能提升 student、有时完全无效,过去解释并不清楚。本文系统研究 OPD 的成功条件和 token-level 机制。
- 发现:OPD 成功需要两个条件:① teacher 与 student 的 thinking pattern 兼容;② teacher 必须提供 student 训练分布中真正没见过的能力。仅仅 teacher 分数更高还不够。论文通过 weak-to-strong reverse distillation 发现,同家族 1.5B 与 7B teacher 从 student 视角可能几乎“分布不可区分”。
- 机制:OPD 的有效学习主要发生在 student 自己访问到的 prefix 上,teacher 与 student 逐步对齐一小批 高概率重叠 token;这部分 token 虽数量少,却承载约 97%–99% 概率质量。因此 OPD 本质不是“把 teacher 全分布搬过去”,而是在 student 自身轨迹上做 dense token-level纠偏。
- Recipe:当 OPD 失败时,作者提出两招:off-policy cold start 先把 student 拉到 teacher 相近思维模式;再做 teacher-aligned prompt selection,挑 teacher 真正有新增信息的样本继续 OPD。
文章目录
- note
- 一、研究动机:OPD 很重要,但为什么会" stronger teacher → worse student "
- 二、论文核心:OPD 有效的两个必要条件 + 一个 token 级机制
- 2.1 条件一:思维范式一致(Thinking-pattern consistency)
- 2.2 条件二:高分 ≠ 新知识(Higher scores ≠ new knowledge)
- 2.3 机制:梯度信号集中在"重叠 token"这个小集合上
- 2.4 三种监督粒度(论文 §2.2)
- 三、实验结果与分析
- 3.1 现象验证:反向蒸馏(Reverse Distillation)
- 3.2 机制验证:动态签名
- 3.3 配方(Recipe):两条修复策略
- 策略一:Off-policy Cold Start(离策略冷启动)
- 策略二:Teacher-aligned Prompt Selection(教师对齐提示选择)
- 3.4 成本(Cost):密集监督的"免费午餐"并不免费
- 四、总结与启示
- 五、局限与待澄清点
一、研究动机:OPD 很重要,但为什么会" stronger teacher → worse student "
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
清华大学等,2026-04-15 | 代码:github.com/thunlp/OPD
On-policy distillation(OPD,同策略蒸馏)指:让学生模型自己采样生成轨迹,再用教师模型对这批"学生真正访问过的状态"给出的逐 token 对数概率作为密集监督信号。相比离线蒸馏(SFT 在教师固定输出上训练,存在 exposure bias),OPD 被认为更高效、更贴合强化学习式的后训练。Qwen3、MiMo、GLM-5 的后训练流程都采用了它;Thinking Machines Lab 也以远低于 RL 的计算量复现了 Qwen3 的 OPD 配方。
但实践中有个刺眼现象:一个更强的教师可能完全无法提升学生,而一个更弱的教师反而成功——哪怕弱教师与学生的初始对齐度更低。这说明"教师分数更高"既不是 OPD 有效的充分条件,也不是必要条件。论文要回答三个问题:
- 现象层面:什么条件下 OPD 成功 / 失败?(§3 Phenomenology)
- 机制层面:为什么教师 token 级信号能把学生分布推到正确方向?(§4 Mechanism)
- 配方层面:失败配置能否被修复?密集监督有没有隐藏成本?(§5–§6 Recipe & Cost)
二、论文核心:OPD 有效的两个必要条件 + 一个 token 级机制
左边:为什么强 teacher 不一定有效
论文发现,teacher benchmark 分数更高,不代表 student 就一定能学到。关键是 teacher/student 的 thinking pattern 是否兼容,以及 teacher 是否真的提供了新的信息增益。
中间:OPD 真正学的是什么
成功 OPD 的特征是:student 在自己访问到的 states 上,逐渐和 teacher 对齐一小部分 高概率 overlap tokens;虽然 token 数不多,但承载了约 97%–99% 的概率质量。
右边:失败了怎么救
用 off-policy cold start 先把 student 拉到 teacher 相近的思维模式,再做 teacher-aligned prompt selection,挑真正有新增知识的样本继续 OPD
2.1 条件一:思维范式一致(Thinking-pattern consistency)
师生应在高概率 token 集合上高度重叠,即"想在同一个地方"。用Overlap Ratio度量:
M overlap = E t [ ∣ S t ( p ) ∩ S t ( q ) ∣ k ] , S t ( p ) = TopK ( p t , k ) , S t ( q ) = TopK ( q t , k ) \mathcal M_{\text{overlap}} = \mathbb E_t\Big[\frac{|S_t^{(p)} \cap S_t^{(q)}|}{k}\Big],\quad S_t^{(p)}=\text{TopK}(p_t,k),\;S_t^{(q)}=\text{TopK}(q_t,k)Moverlap=Et[k∣St(p)∩St(q)∣],St(p)=TopK(pt,k),St(q)=TopK(qt,k)
- 低重叠 ⇒ 学生的概率质量集中在与教师不相交的 token 上 ⇒ 策略"错峰",教师信号指不到学生身上。
- 即使教师 benchmark 更高,思维范式不匹配会造成很低的初始重叠,训练也补不回来。
2.2 条件二:高分 ≠ 新知识(Higher scores ≠ new knowledge)
即便范式一致、教师分数更高,若师生用同一份数据、同一套配方训练,二者会在各自规模下收敛到相似的分布——教师已经没有可迁移的新信号。只有教师携带了学生训练期间未曾见过的知识时,OPD 才有实质增益。
关键反直觉结论(弱到强反向蒸馏验证):用 1.5B 学生去蒸馏 7B 同族教师,往往无效——二者在分布上对学生而言"不可区分"。OPD 学的是思维范式,而不只是"蹭到更高质量"。
2.3 机制:梯度信号集中在"重叠 token"这个小集合上
成功 OPD 的动态签名(dynamic signature):
| 观测量 | 失败运行 | 成功运行 |
|---|---|---|
| Overlap Ratio | 停滞不前 | 72% → 91%+(持续上升) |
| 熵差H ( p t ) − H ( q t ) H(p_t)-H(q_t)H(pt)−H(qt) | 始终偏大 | 逐渐收窄 |
| 共享 top-k 的累计概率质量 | — | 97%–99% |
Overlap-Token Advantage(重叠集上的p ˉ t ( v ) [ log q ˉ t ( v ) − log p ˉ t ( v ) ] \bar p_t(v)[\log\bar q_t(v)-\log\bar p_t(v)]pˉt(v)[logqˉt(v)−logpˉt(v)]均值)趋近于 0,表示学生在教师偏好的 token 上以恰当置信度分配了质量。
因果验证:只在重叠 token 上计算 KL 监督,性能与完整 top-k 监督持平→ 重叠集就是 OPD 梯度的主作用域(principal locus)。
2.4 三种监督粒度(论文 §2.2)
| 方式 | 计算 | 梯度密度 | 代价 |
|---|---|---|---|
| Sampled-token OPD | 只在学生采样到的 token 上算log p t − log q t \log p_t-\log q_tlogpt−logqt | 最低(无偏单样本估计) | 最省,工业界最常用 |
| Full-vocabulary OPD | 全词表 KL | 最高 | O ( B T M ) O(BTM)O(BTM)显存 |
| Top-k OPD | 仅在S t = TopK ( p t , k ) S_t=\text{TopK}(p_t,k)St=TopK(pt,k)上 renormalize 后算 KL | 中等 | 折中,保留高概率区多 token 监督 |
三、实验结果与分析
3.1 现象验证:反向蒸馏(Reverse Distillation)
设置:固定学生(如 Qwen3-1.5B),换不同教师,同配方 OPD。
- 同族 1.5B ↔ 7B:分布对学生视角"不可区分",增益极小 → 验证条件二。
- 跨范式 / 跨家族强教师:初始重叠低,训练无法修复 → 验证条件一。
- 更弱但范式一致的教师:反而成功。
- 训练动态可与 benchmark 分数完全解耦:分数在涨,overlap 不涨 ⇒ 无效训练。
📖对应论文图表:Figure 1(失败案例对比)、Figure 2(反向蒸馏的 performance vs. overlap 散点/曲线)。读图要点:横轴训练步数,纵轴看"benchmark 曲线"与"overlap 曲线"是否同步;不同教师用不同颜色,找"分数高但重叠平"的那条线。
3.2 机制验证:动态签名
- Overlap Ratio 曲线:成功组单调上升至 0.9 附近;失败组贴地走平。
- Entropy gap 曲线:成功组收敛到 0 附近;失败组保持显著正值(学生比教师"更不确定/更散")。
- Probability mass on shared set:97%–99%,说明只要对齐高概率 token,就等于对齐了几乎所有概率质量。
- Ablation:仅重叠 token 监督 ≈ 全 top-k 监督;仅非重叠 token 监督 ≪ 全监督 → 梯度信号确由重叠集承载。
📖对应论文图表:Figure 3 / Figure 4(overlap、entropy gap、advantage 随训练步数变化),以及"overlap-only vs full-top-k"的柱状对比。读图要点:看曲线斜率与终点,不看绝对数值;看 shaded area(方差)判断是否稳定。
3.3 配方(Recipe):两条修复策略
策略一:Off-policy Cold Start(离策略冷启动)
- 做法:OPD 之前加一段 SFT warmup,直接在教师生成的 rollout上训练。
- 作用:把初始 overlap ratio 抬起来,桥接思维范式鸿沟。
- 效果:原本失败的配置被救回,且恢复后呈现"overlap 上升 + advantage 改善 + 熵差收窄"的成功签名。
策略二:Teacher-aligned Prompt Selection(教师对齐提示选择)
- 做法:从教师后训练数据中挑选 prompt 用于 OPD。
- 作用:让学生访问的状态更贴近教师擅长的高概率区域,sharpens 对齐。
- 副作用:学生熵显著下降(分布变"窄"、多样性丧失)。
- 解法:与out-of-distribution prompt 混合使用,在对齐与探索之间取平衡。
📖对应论文图表:Table 1 / Table 2(各策略的 benchmark 增益)+ 相应动态曲线。读图要点:先看"是否从失败变成功",再看"熵是否被压塌"——策略二必须配合 OOD 混合才健康。
3.4 成本(Cost):密集监督的"免费午餐"并不免费
- 奖励质量随轨迹深度衰减:教师作为 reward model 的判别力,在 rollout 越靠后的 token 上越差。
- 不稳定性从源头向后传播:先出现在后期 token,再反向传播到整条轨迹。
- 惊人发现:即便是"失败的教师",其奖励信号与 rollout 正确性仍是全局相关的(globally correlated)。
⇒ 失败不是信号质量差,而是局部优化几何(local optimization geometry)的问题:更大的教师可能在学生策略附近制造了一个局部平坦的奖励景观,使 token 级梯度"推不动"。 - 根本张力:监督密度 ↑ ↔ 监督可靠性 ↓。这指向 OPD 在长程推理与 agentic 场景的缩放瓶颈。
📖对应论文图表:Figure 5 / Figure 6(reward quality / token-level advantage 随 token 位置或 rollout 长度的变化)。读图要点:找"随深度单调下降"的趋势线与拐点(论文给出 1K → +0.37,16K → +0.02 的量级)。
四、总结与启示
OPD 的本质是"在学生走过的路上,把高概率 token 的分配往教师的方向掰"。因此它要求:① 师生想在同一处(overlap 高);② 教师真有学生没见过的东西(新知识)。满足则"渐进对齐、熵差收窄、重叠集承载 97%+ 概率质量";不满足则"重叠停滞、熵差顽固、分数白涨"。修复手段是先离策略 SFT 抬重叠,再教师对齐 prompt sharpen 对齐(须混 OOD 防熵塌)。而密集监督的可靠性随轨迹变长而衰减,构成 OPD 通往长程 agent 的根本性障碍。
给实践者的三条可操作建议:
- 别只看教师 benchmark,先算初始 Overlap Ratio——低于 ~0.7 就要警惕,优先考虑同族/同范式教师或先做 cold start。
- 监控训练动态,而非只看任务分数:overlap ↑、entropy gap ↓、advantage → 0 三者同步,才是真在学。
- 长轨迹场景慎用纯 OPD:后半段 token 的教师奖励已接近噪声,应转向"分段/稀疏 + 结果级奖励"的混合目标。
五、局限与待澄清点
- 模型与任务范围:结论主要在 Qwen3 / DeepSeek 系、0.5B–7B、数学推理任务上成立;跨家族、跨模态、代码、agent 的泛化性待验证。
- "分布不可区分"是操作化定义:以 top-k 重叠与 benchmark 增益为判据,非严格分布等价。
- 成本章偏现象学:奖励质量衰减的因果归因(长度?教师置信度?标注噪声?)尚未被完全隔离。
- Self-distillation 外推:论文提及"单模型 + 特权信息"的自蒸馏方向,但本文实验以异模型师生为主,结论不能直接套用。
- 配方超参:cold start 步数、top-k 的 k、OOD 混合比例,论文未给出跨场景稳健的默认值。