☰
【OPD】Rethinking On-Policy Distillation: Phenomenology, Mechanism, and Recipe
2026/10/8 6:57:20 网站建设 项目流程

note

  • 动机:OPD 已成为后训练常用方法,但一个强 teacher 为什么有时能提升 student、有时完全无效,过去解释并不清楚。本文系统研究 OPD 的成功条件和 token-level 机制。
  • 发现:OPD 成功需要两个条件:① teacher 与 student 的 thinking pattern 兼容;② teacher 必须提供 student 训练分布中真正没见过的能力。仅仅 teacher 分数更高还不够。论文通过 weak-to-strong reverse distillation 发现,同家族 1.5B 与 7B teacher 从 student 视角可能几乎“分布不可区分”。
  • 机制:OPD 的有效学习主要发生在 student 自己访问到的 prefix 上,teacher 与 student 逐步对齐一小批 高概率重叠 token;这部分 token 虽数量少,却承载约 97%–99% 概率质量。因此 OPD 本质不是“把 teacher 全分布搬过去”,而是在 student 自身轨迹上做 dense token-level纠偏。
  • Recipe:当 OPD 失败时,作者提出两招:off-policy cold start 先把 student 拉到 teacher 相近思维模式;再做 teacher-aligned prompt selection,挑 teacher 真正有新增信息的样本继续 OPD。

文章目录

    • note
    • 一、研究动机:OPD 很重要,但为什么会" stronger teacher → worse student "
    • 二、论文核心:OPD 有效的两个必要条件 + 一个 token 级机制
      • 2.1 条件一:思维范式一致(Thinking-pattern consistency)
      • 2.2 条件二:高分 ≠ 新知识(Higher scores ≠ new knowledge)
      • 2.3 机制:梯度信号集中在"重叠 token"这个小集合上
      • 2.4 三种监督粒度(论文 §2.2)
    • 三、实验结果与分析
      • 3.1 现象验证:反向蒸馏(Reverse Distillation)
      • 3.2 机制验证:动态签名
      • 3.3 配方(Recipe):两条修复策略
        • 策略一:Off-policy Cold Start(离策略冷启动)
        • 策略二:Teacher-aligned Prompt Selection(教师对齐提示选择)
      • 3.4 成本(Cost):密集监督的"免费午餐"并不免费
    • 四、总结与启示
    • 五、局限与待澄清点

一、研究动机:OPD 很重要,但为什么会" stronger teacher → worse student "

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
清华大学等,2026-04-15 | 代码:github.com/thunlp/OPD

On-policy distillation(OPD,同策略蒸馏)指:让学生模型自己采样生成轨迹,再用教师模型对这批"学生真正访问过的状态"给出的逐 token 对数概率作为密集监督信号。相比离线蒸馏(SFT 在教师固定输出上训练,存在 exposure bias),OPD 被认为更高效、更贴合强化学习式的后训练。Qwen3、MiMo、GLM-5 的后训练流程都采用了它;Thinking Machines Lab 也以远低于 RL 的计算量复现了 Qwen3 的 OPD 配方。

但实践中有个刺眼现象:一个更强的教师可能完全无法提升学生,而一个更弱的教师反而成功——哪怕弱教师与学生的初始对齐度更低。这说明"教师分数更高"既不是 OPD 有效的充分条件,也不是必要条件。论文要回答三个问题:

  1. 现象层面:什么条件下 OPD 成功 / 失败?(§3 Phenomenology)
  2. 机制层面:为什么教师 token 级信号能把学生分布推到正确方向?(§4 Mechanism)
  3. 配方层面:失败配置能否被修复?密集监督有没有隐藏成本?(§5–§6 Recipe & Cost)

二、论文核心:OPD 有效的两个必要条件 + 一个 token 级机制


左边:为什么强 teacher 不一定有效
论文发现,teacher benchmark 分数更高,不代表 student 就一定能学到。关键是 teacher/student 的 thinking pattern 是否兼容,以及 teacher 是否真的提供了新的信息增益。

中间:OPD 真正学的是什么
成功 OPD 的特征是:student 在自己访问到的 states 上,逐渐和 teacher 对齐一小部分 高概率 overlap tokens;虽然 token 数不多,但承载了约 97%–99% 的概率质量。

右边:失败了怎么救
用 off-policy cold start 先把 student 拉到 teacher 相近的思维模式,再做 teacher-aligned prompt selection,挑真正有新增知识的样本继续 OPD

2.1 条件一:思维范式一致(Thinking-pattern consistency)

师生应在高概率 token 集合上高度重叠,即"想在同一个地方"。用Overlap Ratio度量:

M overlap = E t [ ∣ S t ( p ) ∩ S t ( q ) ∣ k ] , S t ( p ) = TopK ( p t , k ) , S t ( q ) = TopK ( q t , k ) \mathcal M_{\text{overlap}} = \mathbb E_t\Big[\frac{|S_t^{(p)} \cap S_t^{(q)}|}{k}\Big],\quad S_t^{(p)}=\text{TopK}(p_t,k),\;S_t^{(q)}=\text{TopK}(q_t,k)Moverlap​=Et​[k∣St(p)​∩St(q)​∣​],St(p)​=TopK(pt​,k),St(q)​=TopK(qt​,k)

  • 低重叠 ⇒ 学生的概率质量集中在与教师不相交的 token 上 ⇒ 策略"错峰",教师信号指不到学生身上。
  • 即使教师 benchmark 更高,思维范式不匹配会造成很低的初始重叠,训练也补不回来。

2.2 条件二:高分 ≠ 新知识(Higher scores ≠ new knowledge)

即便范式一致、教师分数更高,若师生用同一份数据、同一套配方训练,二者会在各自规模下收敛到相似的分布——教师已经没有可迁移的新信号。只有教师携带了学生训练期间未曾见过的知识时,OPD 才有实质增益。

关键反直觉结论(弱到强反向蒸馏验证):用 1.5B 学生去蒸馏 7B 同族教师,往往无效——二者在分布上对学生而言"不可区分"。OPD 学的是思维范式,而不只是"蹭到更高质量"。

2.3 机制:梯度信号集中在"重叠 token"这个小集合上

成功 OPD 的动态签名(dynamic signature):

观测量失败运行成功运行
Overlap Ratio停滞不前72% → 91%+(持续上升)
熵差H ( p t ) − H ( q t ) H(p_t)-H(q_t)H(pt​)−H(qt​)始终偏大逐渐收窄
共享 top-k 的累计概率质量—97%–99%

Overlap-Token Advantage(重叠集上的p ˉ t ( v ) [ log ⁡ q ˉ t ( v ) − log ⁡ p ˉ t ( v ) ] \bar p_t(v)[\log\bar q_t(v)-\log\bar p_t(v)]pˉ​t​(v)[logqˉ​t​(v)−logpˉ​t​(v)]均值)趋近于 0,表示学生在教师偏好的 token 上以恰当置信度分配了质量。

因果验证:只在重叠 token 上计算 KL 监督,性能与完整 top-k 监督持平→ 重叠集就是 OPD 梯度的主作用域(principal locus)。

2.4 三种监督粒度(论文 §2.2)

方式计算梯度密度代价
Sampled-token OPD只在学生采样到的 token 上算log ⁡ p t − log ⁡ q t \log p_t-\log q_tlogpt​−logqt​最低(无偏单样本估计)最省,工业界最常用
Full-vocabulary OPD全词表 KL最高O ( B T M ) O(BTM)O(BTM)显存
Top-k OPD仅在S t = TopK ( p t , k ) S_t=\text{TopK}(p_t,k)St​=TopK(pt​,k)上 renormalize 后算 KL中等折中,保留高概率区多 token 监督

三、实验结果与分析

3.1 现象验证:反向蒸馏(Reverse Distillation)

设置:固定学生(如 Qwen3-1.5B),换不同教师,同配方 OPD。

  • 同族 1.5B ↔ 7B:分布对学生视角"不可区分",增益极小 → 验证条件二。
  • 跨范式 / 跨家族强教师:初始重叠低,训练无法修复 → 验证条件一。
  • 更弱但范式一致的教师:反而成功。
  • 训练动态可与 benchmark 分数完全解耦:分数在涨,overlap 不涨 ⇒ 无效训练。

📖对应论文图表:Figure 1(失败案例对比)、Figure 2(反向蒸馏的 performance vs. overlap 散点/曲线)。读图要点:横轴训练步数,纵轴看"benchmark 曲线"与"overlap 曲线"是否同步;不同教师用不同颜色,找"分数高但重叠平"的那条线。

3.2 机制验证:动态签名

  • Overlap Ratio 曲线:成功组单调上升至 0.9 附近;失败组贴地走平。
  • Entropy gap 曲线:成功组收敛到 0 附近;失败组保持显著正值(学生比教师"更不确定/更散")。
  • Probability mass on shared set:97%–99%,说明只要对齐高概率 token,就等于对齐了几乎所有概率质量。
  • Ablation:仅重叠 token 监督 ≈ 全 top-k 监督;仅非重叠 token 监督 ≪ 全监督 → 梯度信号确由重叠集承载。

📖对应论文图表:Figure 3 / Figure 4(overlap、entropy gap、advantage 随训练步数变化),以及"overlap-only vs full-top-k"的柱状对比。读图要点:看曲线斜率与终点,不看绝对数值;看 shaded area(方差)判断是否稳定。

3.3 配方(Recipe):两条修复策略

策略一:Off-policy Cold Start(离策略冷启动)
  • 做法:OPD 之前加一段 SFT warmup,直接在教师生成的 rollout上训练。
  • 作用:把初始 overlap ratio 抬起来,桥接思维范式鸿沟。
  • 效果:原本失败的配置被救回,且恢复后呈现"overlap 上升 + advantage 改善 + 熵差收窄"的成功签名。
策略二:Teacher-aligned Prompt Selection(教师对齐提示选择)
  • 做法:从教师后训练数据中挑选 prompt 用于 OPD。
  • 作用:让学生访问的状态更贴近教师擅长的高概率区域,sharpens 对齐。
  • 副作用:学生熵显著下降(分布变"窄"、多样性丧失)。
  • 解法:与out-of-distribution prompt 混合使用,在对齐与探索之间取平衡。

📖对应论文图表:Table 1 / Table 2(各策略的 benchmark 增益)+ 相应动态曲线。读图要点:先看"是否从失败变成功",再看"熵是否被压塌"——策略二必须配合 OOD 混合才健康。

3.4 成本(Cost):密集监督的"免费午餐"并不免费

  • 奖励质量随轨迹深度衰减:教师作为 reward model 的判别力,在 rollout 越靠后的 token 上越差。
  • 不稳定性从源头向后传播:先出现在后期 token,再反向传播到整条轨迹。
  • 惊人发现:即便是"失败的教师",其奖励信号与 rollout 正确性仍是全局相关的(globally correlated)。
    ⇒ 失败不是信号质量差,而是局部优化几何(local optimization geometry)的问题:更大的教师可能在学生策略附近制造了一个局部平坦的奖励景观,使 token 级梯度"推不动"。
  • 根本张力:监督密度 ↑ ↔ 监督可靠性 ↓。这指向 OPD 在长程推理与 agentic 场景的缩放瓶颈。

📖对应论文图表:Figure 5 / Figure 6(reward quality / token-level advantage 随 token 位置或 rollout 长度的变化)。读图要点:找"随深度单调下降"的趋势线与拐点(论文给出 1K → +0.37,16K → +0.02 的量级)。


四、总结与启示

OPD 的本质是"在学生走过的路上,把高概率 token 的分配往教师的方向掰"。因此它要求:① 师生想在同一处(overlap 高);② 教师真有学生没见过的东西(新知识)。满足则"渐进对齐、熵差收窄、重叠集承载 97%+ 概率质量";不满足则"重叠停滞、熵差顽固、分数白涨"。修复手段是先离策略 SFT 抬重叠,再教师对齐 prompt sharpen 对齐(须混 OOD 防熵塌)。而密集监督的可靠性随轨迹变长而衰减,构成 OPD 通往长程 agent 的根本性障碍。

给实践者的三条可操作建议:

  1. 别只看教师 benchmark,先算初始 Overlap Ratio——低于 ~0.7 就要警惕,优先考虑同族/同范式教师或先做 cold start。
  2. 监控训练动态,而非只看任务分数:overlap ↑、entropy gap ↓、advantage → 0 三者同步,才是真在学。
  3. 长轨迹场景慎用纯 OPD:后半段 token 的教师奖励已接近噪声,应转向"分段/稀疏 + 结果级奖励"的混合目标。

五、局限与待澄清点

  • 模型与任务范围:结论主要在 Qwen3 / DeepSeek 系、0.5B–7B、数学推理任务上成立;跨家族、跨模态、代码、agent 的泛化性待验证。
  • "分布不可区分"是操作化定义:以 top-k 重叠与 benchmark 增益为判据,非严格分布等价。
  • 成本章偏现象学:奖励质量衰减的因果归因(长度?教师置信度?标注噪声?)尚未被完全隔离。
  • Self-distillation 外推:论文提及"单模型 + 特权信息"的自蒸馏方向,但本文实验以异模型师生为主,结论不能直接套用。
  • 配方超参:cold start 步数、top-k 的 k、OOD 混合比例,论文未给出跨场景稳健的默认值。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询