原理推导题:训练、微调与对齐(10 题)
2026/9/5 2:01:42 网站建设 项目流程

原理推导题和手撕代码题是两种考法。手撕题筛的是「写没写过」,推导题筛的是「想没想通」:面试官给你一个现象(Pre-Norm 稳、BF16 不用 loss scale、LoRA 省参数),看你能不能从第一性原理一路推到这个结论。答这类题的死法也很统一:名词堆砌。说一堆「梯度直通」「低秩假设」「对齐税」,面试官一句「所以为什么会这样」就露馅。正确答法是每一步都说因果:因为 A,所以 B,B 又导致 C,结论自然落地。中途被打断追问某一步是常态,能接住任意一步的人才是真懂。

题目结构说明:每题四部分。考点定位讲面试官在筛什么;推导链分步骤把因果讲到底,关键处给公式或具体数字;能背的最小集是考前必须记住的一两个数字或结论;追问链是推导讲完后大概率跟上的问题,附一句话答法。伪代码只在真有帮助时给(如 LoRA 前向、梯度检查点)。标记:⭐ 高频(出现率过半)、🔥 近两年新增。


Q1 为什么 Pre-Norm 比 Post-Norm 训练更稳?⭐

考点定位:代码实现层面本系列 V01 Q5 已逐行拆过,本篇只推稳定性这条因果链。这道题考的是「从反向传播推训练稳定性」的基本功。背得出「梯度直通」四个字的人很多,能写出两种结构的梯度式并指出差异在哪一项的,不到两成。

推导链

  1. 先写出两种结构。Post-Norm(原始 Transformer):x_{l+1} = Norm(x_l + F(x_l)),norm 在残差合流之后。Pre-Norm(GPT-2 起):x_{l+1} = x_l + F(Norm(x_l)),norm 挪进分支,主干上是干净的加法。

  2. 对 Post-Norm 求梯度:∂x_{l+1}/∂x_l = J_Norm · (I + ∂F/∂x_l)。注意最左边乘了一个 J_Norm,即归一化层的雅可比。归一化的本质是除以该处激活的标准差并重新中心化,它的雅可比作用在梯度上等于一次重新缩放。

  3. 这个缩放单层无所谓,但 N 层串联后梯度被 J_Norm 连乘 N 次。训练初期激活尺度未定,这个连乘积既可能把梯度压没(梯度消失)也可能放大(梯度爆炸),深度越深越不可控。这就是原版 Transformer 训 12 层都要配 2 万步 warmup 才不发散的原因。

  4. 再看 Pre-Norm:∂x_{l+1}/∂x_l = I + J_Norm · ∂F/∂x_l。关键是恒等项 I:梯度有一条不经过任何缩放的直通通路,任意深层的梯度都能原样传回底层,梯度范数随深度的波动有界。深层的训练稳定性由此而来,warmup 需求大幅下降。

  5. 代价也要讲全:主干没有人管尺度,激活范数随层数缓慢增长,所以最后必须补一个 final norm 再接输出层;同参数量下 Pre-Norm 等效深度略浅,训得动的 Post-Norm 性能上限略高,这是后来 sandwich-norm、DeepNorm 这类工作想两头兼得的原因。

能背的最小集:Pre-Norm 的梯度是I + 分支项,恒等项保直通;Post-Norm 原版要 2 万步 warmup,Pre-Norm 基本免了。

追问链

  • 「为什么最后的 final norm 不能省?」-> 主干尺度随层数增长,softmax 前需要稳定 logits 尺度,省掉会导致输出漂移。

  • 「既然 Pre-Norm 更稳,为什么还有模型用 Post-Norm?」-> 超大模型配精细 warmup 时 Post-Norm 上限略高,部分新模型用 sandwich(前后都 norm)折中。

  • 「这和 RMSNorm 的关系?」-> 正交。Pre/Post 说的是 norm 放哪,RMSNorm 说的是 norm 怎么算(去掉均值中心化),现代模型通常是 Pre + RMSNorm。


Q2 Scaling Law 怎么推导和运用?Chinchilla 最优算力分配 ⭐

考点定位:考有没有真推过 Chinchilla 的最优解,而不是背「20 倍数据」。能把拉格朗日乘数法那步说顺的人,面试官会默认数学底子过关。

推导链

  1. 经验定律的形态:损失随参数量 N、数据量 D、算力 C 呈幂律下降。Kaplan 2020 的形式L(N) = (N_c/N)^α,Chinchilla 用联合形式L(N, D) = E + A·N^(-α) + B·D^(-β),E 是不可约损失(熵下界),α 约 0.34,β 约 0.28,两项分别对应参数不足和数据不足的惩罚。

  2. 约束是算力:前向约 2ND FLOPs,反向约两倍,合计C = 6ND。这就是面试必写的 6ND。

  3. 在 C 固定下最小化 L:对 N、D 做拉格朗日,分别对 N 和 D 求偏导并利用 ND = C/6 消元,得到最优规模N* ∝ C^(β/(α+β))D* ∝ C^(α/(α+β))。代回数值,两个指数都接近 0.5。

  4. 结论:算力翻 4 倍,模型应放大 2 倍、数据也放大 2 倍,两者等比例增长,最优 tokens/参数比约 20。验证案例:GPT-3 是 175B 参数配 300B tokens(约 1.7 倍),严重参数过剩;Chinchilla 用同等算力改训 70B 配 1.4T tokens(约 20 倍),全面胜出。

  5. 运用层的修正:20 倍是「训练最优」,不是「推理最优」。模型训完要服务海量请求,推理成本随 N 增长,所以 LLaMA 系主动超训小模型(7B 训 2T tokens,近 300 倍),把成本从训练侧挪到推理侧。这是 Scaling Law 的工程化用法:定律没变,目标函数变了。

能背的最小集C = 6ND,最优配比约 20 tokens/参数;LLaMA

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询