期末备考季,被"最大似然估计"卡住的人不在少数。很多同学背得下步骤,却说不清"为什么要取对数",更怕遇到"求导求不出"的题。这篇文章我把最大似然估计掰开揉碎讲一遍,从原理、标准解题流程到考场陷阱,按期末考试的出题逻辑走一遍,目标是让你会做题、能拿分、不丢冤枉分。适合正在复习概率论与数理统计、尤其是考前冲刺的本科同学,也适合考研基础阶段想一次学透这块内容的人。
1. 期末考纲里的"必考大户":最大似然估计到底在考什么
1.1 为什么每个学校都爱出这道题
先给结论:最大似然估计是参数点估计里最核心的方法,也是期末考试和考研数学最稳定的得分题之一。它的地位高,因为出卷老师很偏爱"原理+运算+辨析"的组合考法——一道题能同时考察你是否理解概率模型、会不会算导数、懂不懂统计量的含义。
从历年的试卷分布看,最大似然估计的题目呈现几个固定特征:
- 分值通常在10到15分,属于大题区间,而且往往是"参数估计"章节里最重的一道;
- 出题形式大多是"设总体X的概率密度/分布律为……,求参数θ的最大似然估计量",偶尔会追加一问"并判断是否无偏";
- 考察类型集中在指数分布、正态分布、泊松分布、伯努利分布、均匀分布这五类常见总体上,换汤不换药。
我把这五类分布的考法差异整理成一张表,后面逐个展开:
| 总体分布 | 未知参数 | 最大似然估计结果 | 核心运算工具 |
|---|---|---|---|
| 伯努利分布 | p | 样本均值 | 对数似然求导 |
| 泊松分布 | λ | 样本均值 | 对数似然求导 |
| 指数分布 | λ | 样本均值的倒数 | 对数似然求导 |
| 正态分布 | μ和σ² | 样本均值、二阶中心矩 | 偏导联立方程组 |
| 均匀分布 | θ | 样本最大值 | 单调性判断,不靠求导 |
这张表你在考前如果能闭眼写出来,基础分就到手一半了。剩下的关键差距,全在"算得对不对、扣分点躲不躲得过"上。
1.2 先判断你的试卷侧重哪种考法
不同学校、不同老师对这部分的要求侧重不太一样。我建议你动手复习前先看两样东西:课件里关于"极大似然估计"那几页的例子,以及往年试卷的真题。观察它们更偏向偏导方程组运算,还是偏向定义域与边界讨论。
如果历年真题反复出现带"若样本观测值为……"的数值计算题,说明阅卷时对计算过程和最终数字的精度有要求;如果真题经常问"求矩估计与最大似然估计并比较",那说明你不仅要会算,还要会说明无偏性、相合性这些性质。看清楚目标再复习,效率会高很多。
2. 似然函数不是概率:真正理解MLE的第一步
2.1 一次掷硬币实验把"似然"讲透
"最大似然估计"这个名词对新手很不友好,因为它把两个抽象概念叠在一起。我们先拆第一个:似然函数到底是个什么东西。
想象一个最朴素的场景——拿一枚不知道正反面概率的硬币抛了10次,结果是7次正面3次反面。假设这枚硬币正面概率是p,那么出现"7正3反"这个结果的概率是:
P(结果|p) = p⁷(1-p)³
现在反过来想:已知结果是"7正3反",你想要猜p等于多少。把上面等式的左右两边换个视角,固定住"结果已发生"这个事实,把p当成变量,这个关于p的函数就叫"似然函数"。它的含义是:在某个p取值下,"能产生这组已有数据"的可能性有多大。注意,它不再是通常意义上的概率了——因为分母和样本空间的规约方式不同,但数学形式上很接近。
这里有个关键思维转换:平时我们求概率是"已知参数,猜结果",而似然是"已知结果,猜参数"。如果你做题目时总想不通L(θ)的表达式为什么那样写,就往这个方向想——把样本观测值当成给定的、发生过的数据,参数是我们需要搜索的对象。
2.2 为什么取对数不会改变最大值的位置
理解了似然函数的含义,下一个高频疑问马上就会冒出来:"为什么算最大似然估计的时候一定要先取对数?"
原因有两个,一个纯粹是计算便利,一个是数值稳定性。
计算便利显而易见:n个独立样本的联合密度是单个密度的乘积,L(θ) = ∏ f(xᵢ;θ)。乘积求导要用乘法法则,项数一多,表达式立刻爆炸。而取对数后,乘积变成求和,ln L(θ) = Σ ln f(xᵢ;θ),求导只需要对每一项分别求导再累加,简洁得多。
数值稳定性也很实际:n稍微大一点,哪怕每项密度只有0.1左右,连乘起来就会趋近于0,计算机的浮点数精度根本扛不住。取对数之后,数值变成负数累加,范围小得多,不会出现下溢出。期末考试虽然不让你手算一百个样本连乘,但理解和应用是一致的。
最需要强调的是:ln函数在(0, +∞)上是严格单调递增的,所以ln L(θ)和L(θ)在同一个θ处取得最大值。"取对数不影响极值点位置"这一句话,是你所有"先取对数再求导"操作的合法性依据。我在批改作业时经常见同学在大题开头写一句纯粹刻板的公式套用,却根本不解释"为什么可以取对数",这一环的缺失在阅卷严的老师手里绝对要扣分。
3. 连续型总体的标准解题路线:正态分布一步一步拆给你看
3.1 写似然函数前,先盯住定义域
初学者最容易被带偏的地方,是先急着去连乘、取对数、求导,忘了写下参数和样本的取值范围。而定义域恰恰决定了后面几步的合法性,甚至决定了整个题目的答案结构。
对于连续型总体,总体密度函数通常是一个分段函数——比如指数分布只在x>0有密度,均匀分布在区间[a,b]外密度为0。样本值是已经观测到的固定数,那么概率密度函数就必须在每个观测点上都为正,否则对数里的0会直接让lnL趋近负无穷,最大似然法就崩了。
这意味着,当参数的取值范围和样本观测值的范围绑定时,你必须把这个约束条件写进似然函数里。最常见的就是均匀分布U(0,θ)那种情形——它的密度在x>θ的部分是0,因此样本的最大值一旦超过θ,整个似然函数就等于0,不可能是最大值候选。很多同学最后一步算错,根子都在这里。
3.2 取对数求导的标准姿势
当定义域搞清楚了,后续步骤就成了一套固定流程。我用正态分布N(μ, σ²)做全流程演示,因为这是期末考试里最标准、最频繁的类型,而且它同时涉及单参数和多参数两种运算,一举两得。
设总体X ~ N(μ, σ²),样本为x₁, x₂, …, xₙ。第一步写出似然函数:
L(μ, σ²) = ∏ (1/√(2πσ²))·exp(-(xᵢ-μ)²/(2σ²))
这个式子看着吓人,但取对数后会迅速变得清爽:
ln L = -(n/2)ln(2π) - (n/2)ln(σ²) - (1/(2σ²))Σ(xᵢ-μ)²
注意,有时候老师习惯把σ²整体当作一个未知量来求导,有时候又令t = σ²,操作上是等价的。关键是你的求导变量必须明确,不要一会对σ求导一会对σ²求导,那是考场上最常见的运算翻车点。
对μ求偏导,令其为零:
∂ln L/∂μ = Σ(xᵢ-μ)/σ² = 0,解得 μ̂ = x̄
对σ²求偏导时,为了减少错误率,把Σ(xᵢ-μ)²当作常数处理:
∂ln L/∂σ² = -n/(2σ²) + Σ(xᵢ-μ)²/(2σ⁴) = 0,解得 σ̂² = (1/n)Σ(xᵢ-μ̂)²
注意最后一步里,μ也必须用上面算出的估计量x̄替换掉。这是很常见的一个延续性交叉——你求σ̂²的时候如果还在式子里保留μ,或者保留了μ̂但没意识到要代入x̄,整题就乱了。
3.3 正态分布的完整数值案例
只看公式容易飘。我随便构造一组小样本,带你把数值走一遍。
假设观测到5个样本值:3.2,4.1,3.8,4.5,3.4。那么:
样本均值 x̄ = (3.2+4.1+3.8+4.5+3.4)/5 = 19/5 = 3.8
σ̂² = [(3.2-3.8)²+(4.1-3.8)²+(3.8-3.8)²+(4.5-3.8)²+(3.4-3.8)²]/5 = (0.36+0.09+0+0.49+0.16)/5 = 1.10/5 = 0.22
注意这里算出来的σ̂² = 0.22是最大似然估计值,分母用的是n而不是n-1。如果你拿计算器按出"样本方差"是0.275,那是除以n-1的结果,不是MLE的结果。这两个值的关系,期末特别喜欢放在"无偏性"问法里考,后面我专门说。
4. 最容易被扣分的均匀分布:求导失效时的正确处理
4.1 为什么均匀分布不能求导
下面这题基本年年有学校考,也年年有学生翻车:设总体X服从区间[0,θ]上的均匀分布,θ>0未知,样本x₁,…,xₙ已知,求θ的最大似然估计。
很多同学照搬连续型三步曲,先写:
L(θ) = (1/θ)ⁿ
然后取对数求导:ln L = -n ln θ,求导等于-n/θ,令它等于0——越解越奇怪,因为-n/θ根本不可能等于0。
问题出在哪?出在"密度函数是分段函数"这件事被忽略了。均匀分布的密度必须严谨写成:
f(x;θ) = 1/θ,当0 ≤ x ≤ θ;f(x;θ) = 0,当x > θ
所以严格写全,似然函数应该是:
L(θ) = (1/θ)ⁿ,当θ ≥ max(xᵢ);L(θ) = 0,当θ < max(xᵢ)
在θ ≥ max(xᵢ)这个有效范围内,(1/θ)ⁿ是关于θ的单调递减函数,θ越大,似然值越小。既然没有内部极值点,最大值只能出现在定义域的边界上,也就是:
θ̂ = max(xᵢ) = x₍ₙ₎
这就是"端点估计"的典型题目。它给所有"见参数就求导"的同学上了一课:最大似然估计的思想是最大化L(θ),而最大化未必非要在驻点处发生,边界上同样可以取到。
4.2 端点估计变体与参数范围校验
均匀分布还有一类变体也值得考前看两眼。设X服从区间[θ-1, θ+1]上的均匀分布,样本为x₁,…,xₙ,求θ的MLE。
这种题目的正确思路是:区间是一个长度为2的滑窗,要让所有样本点都落在里面,滑窗必须满足 θ-1 ≤ min(xᵢ) 且 θ+1 ≥ max(xᵢ),即:
max(xᵢ) - 1 ≤ θ ≤ min(xᵢ) + 1
在这个区间内,密度值1/2始终为常数(因为区间长度固定),似然值(1/2)ⁿ也是常数,所以θ的任何取值都能让似然函数达到同一个最大值。这种情况下,最大似然估计不唯一。期末如果出这种题,往往问的不是求唯一估计,而是让你指出"所有的最大似然估计构成一个区间"。
另外,在得到任何参数估计值之后,一定要回头校验一步:解出的结果是否落在参数的合法范围里。比如估计出了p = 1.5,但伯努利分布要求p∈[0,1],那就是你的求解过程有问题,多半是忽略了边界条件;再比如均匀分布的θ估计量如果小于了样本最大值,那更不可能,因为样本里已经出现了大于θ的观测值,与概率模型的假设直接矛盾。这个校验习惯考前一定要养成,尤其在考场上时间紧张时,它是成本最低的救命检查。
5. 多参数与离散分布:考场上的进阶问法
5.1 多个未知参数的联立方程操作
正态分布已经展示了两个参数的MLE,这里我把操作要点提炼一下。当未知参数多于一个时,标准流程是:
- 写出完整似然函数L(θ₁,…,θₖ);
- 取对数得到ln L;
- 对每个参数分别求偏导;
- 令所有偏导同时为零,解联立方程组;
- 解得所有参数的表达式。
这套流程在数学上叫"求对数似然函数的驻点"。唯一的额外注意点在于解方程时不要急着代入数值,尽量先把表达式化简成封闭形式。比如正态分布那题,先由第一式得μ̂ = x̄,再把x̄代回第二式得σ̂²的表达式。一旦中间环节开始浮现小数,后面所有运算都会变得容易出错。
有一种进阶题型也值得心里有底:双参数指数分布。设X的密度为 f(x;α,β) = (1/β)exp(-(x-α)/β),其中x>α,β>0。这个题目的MLE求解分为两步——对于α,它的定义域受限于xᵢ>α,且似然函数关于α单调递增,所以α̂ = min(xᵢ);锁定α̂之后,再用求导方法求解β̂ = x̄ - α̂。这种"次序统计量+导数方法"的混合题型,正是均匀分布和正态分布两种考法的融合,遇到了一定要想清楚哪部分用单调性、哪部分用驻点条件。
5.2 泊松分布与伯努利分布的完整实操
离散型总体的最大似然估计,期末同样常考。概率函数里出现的阶乘、指数形式容易让人看花眼,但本质套路没变。
先看泊松分布。设X ~ P(λ),分布律为:
P(X=k) = λᵏe⁻λ/k!
样本x₁,…,xₙ的似然函数为:
L(λ) = ∏(λˣⁱe⁻λ/xᵢ!) = λ^{Σxᵢ}e⁻ⁿλ / ∏(xᵢ!)
取对数:
ln L = (Σxᵢ)lnλ - nλ - Σln(xᵢ!)
注意最后一项Σln(xᵢ!)与λ无关,求导时直接消失。对λ求导:
d(ln L)/dλ = Σxᵢ/λ - n = 0
解得:
λ̂ = Σxᵢ/n = x̄
结论非常干净——泊松分布的参数λ的最大似然估计就是样本均值,这也是这个结论在教科书里被反复强调的原因。
再看伯努利分布。设X ~ B(1,p),P(X=1)=p,P(X=0)=1-p,样本中1的个数记为k,则:
L(p) = pᵏ(1-p)ⁿᐨᵏ
取对数:
ln L = k ln p + (n-k)ln(1-p)
求导:
k/p - (n-k)/(1-p) = 0
解得:
p̂ = k/n = x̄
有没有发现规律?不管离散连续,单参数的大多数常规分布,MLE往往最终都落到样本均值或样本均值的函数上。考试时如果你算出来的结果明显不是一个简单的、可解释的形式,先别急着交卷,重新检查七步流程——八成是哪一步的对数展开出了问题。
5.3 隐含条件:参数范围的二次检查
离散型里还有一个隐蔽的扣分点。比如二项分布B(N,p),参数p的MLE是k/(Nn),但很多人都忽略了一个细节:p̂ = k/(Nn)必须满足0≤p̂≤1。如果把样本量n或二项试验次数N搞混,算出来的比例可能越界。更隐蔽的是,当样本里全是0或者全是1时,p̂会落在端点0或1上,这其实也是合法的MLE——因为似然函数在端点处取最大值,此时你写"p̂=0或p̂=1"是完全正确的,不需要觉得难堪。
很多同学拿到这种极端样本会想着"估计值不能等于0或1吧",然后自作主张改成一个近似值,这是大错特错。最大似然估计的唯一标准是让似然函数最大,端点结果就是最大,不要画蛇添足。
6. 阅卷视角的隐藏扣分点:这些细节决定你拿满分还是半截分
6.1 估计量还是估计值,一字之差就是题设事故
"求θ的最大似然估计量"和"求θ的最大似然估计值"在期末试卷里是有严格区分的大题设问。估计量是用样本随机变量表达的统计量,写作θ̂(X₁,…,Xₙ),是一个随机变量的函数;估计值是把具体观测数字代入后得到的常数,写作θ̂(x₁,…,xₙ)。
正确的回答规范是:
- 题干"求最大似然估计量":最终表达式里保留大写Xᵢ或x̄等统计量符号,不代入具体数;
- 题干"若样本观测值为……,求最大似然估计值":你需要在给出表达式之后,把具体数值代入,算出最终数字。
我在改卷时见过太多学生全程只用小写xᵢ,算到最后也没有任何一句"将观测值代入得……"的说明,直接被扣掉结果分。这个分的损失完全可控——考前只需养成一个习惯:落笔写结论前,看一眼题干问的是"量"还是"值"。
6.2 无偏性校验:MLE有偏并不罕见
期末第二问常垂青"判断该估计量是否无偏"。这里有个非常普遍的误区,很多同学默认"最大似然估计应该都是无偏的"——恰恰相反,这个说法完全不正确。
拿正态分布来说,最大似然估计σ̂² = (1/n)Σ(xᵢ-x̄)²的期望值是:
E(σ̂²) = (n-1)/n · σ²
这个值永远小于σ²,所以σ̂²不是σ²的无偏估计。要想无偏,需要乘上n/(n-1),得到修正的样本方差S² = (1/(n-1))Σ(xᵢ-x̄)²。这就是教科书反复强调"样本方差除以n-1"在统计含义上的根源——不是为了凑自由度,而是为了无偏性。
指数分布Expo(λ)的MLE为λ̂ = 1/x̄,但E(1/x̄)并不等于1/E(x̄) = λ,所以它也是有偏的。考场上如果题目问"判断无偏性",你需要老老实实算期望:
- 对样本均值类估计量,利用E(x̄) = μ通常很快;
- 对非线性变换类估计量,比如1/x̄、x̄²等,不要想当然,要么用密度函数积分算期望,要么利用相关已知结论。
这里我必须给一个提醒:无偏性判断是档位分,算出来结果不同,整题可能少拿一半分。不要因为"我觉得应该无偏"就跳过期望计算,那是在赌运气。
6.3 连续运算中的数值精度
期末计算很简单,但用计算器也有学问。我建议采用"全程保留表达式、最后一步再代数字"的策略。比如算x̄时,如果中间商是分数,就先用分数形式保留;万一要用小数,统一保留4位有效数字以上,避免四舍五入误差传到最终结果。
最后的估计值按常规保留3位小数即可。这类题目阅卷通常会看"步骤+末位数字",步骤占比高,实际上只要逻辑正确、算式完整,中途出现很小的计算误差时,阅卷老师通常也会给同情分。但如果你在中间步骤就开始省略和约分,最后结果偏差太大,分数就很难看了。
7. 一周冲刺安排:从"会做"到"做对"
在这里我建议复习计划按"题型分层+套卷节奏"来排,而不是死磕某本教材的一整章。以考前一天为D-1倒推,一个紧凑的节奏可以是这样:
| 时间 | 复习内容 | 完成标准 |
|---|---|---|
| D-7 | 理解似然函数定义+重新推导五类分布的MLE | 不看笔记能写出L(θ)并说出取对数的理由 |
| D-6 | 专项练习连续型单参数(指数、均匀) | 每天10题,错误率降到20%以下 |
| D-5 | 专项练习多参数(正态、双参数指数) | 能熟练解偏导方程组 |
| D-4 | 专项练习离散型(泊松、二项) | 能区分分布律写法且不遗漏阶乘项 |
| D-3 | 无偏性与相合性的配套习题 | 会严格计算期望,不凭直觉判断 |
| D-2 | 两套完整真题卷,限时训练 | 整套试卷在120分钟内完成,MLE部分不超时 |
| D-1 | 错题重做+公式卡片 | 卡片上五类分布的估计量表达式能默写 |
7.1 分题型刷题的三个原则
第一个原则是重质量不重数量。最大似然估计的题型非常有限,吃透一道经典题,胜过盲目刷十道换数不换法的题。建议每做完一道题,自己用一句话概括"这题考了哪个分布、哪个陷阱、用什么手段解决",整理成自己的错题注脚。
第二个原则是限时训练。一道MLE大题,考场上合理分配时间在12到15分钟。平时练习时就要给自己掐表,如果超时,说明对步骤还不熟练,需要用"三步曲"形成肌肉记忆:写L(θ) → 写ln L → 求导解方程。
第三个原则是重算一遍。所有算出的估计量,都用一个小样本手算验证一下趋势是否合理。比如正态分布你算σ̂²,如果比样本方差还大,就要警觉是不是公式写错了——因为σ̂² = (n-1)/n·S²,它理论上不应该超过S²,一旦违背这个直观,必有问题。
7.2 自测时的评分标准模拟
冲剌阶段的自测不要只看对错,建议按阅卷视角给自己打分:
- 似然函数表达式正确,得30%分;
- 取对数并正确化简,再得30%分;
- 求导并解出结果,得30%分;
- 给出估计量、估计值的规范结论及必要的范围验证,得最后10%分。
你可以拿这样一套评分逻辑去判断自己的薄弱环节在哪。多数人失分不在求导,而在"似然函数写错"或者"忘写定义域",这从源头上就决定了后面全是无用功。把前面30%的基础分抓牢,比一味追求速度和复杂题型更划算。
复习到这个时候,你可以合上笔记问自己三个问题:给我一个总体密度,我能立刻写下它的似然函数吗?遇到求导失效的情形,我知道该考虑单调性和边界吗?题干问"估计量"还是"估计值",我能规范作答吗?如果答案都是肯定的,那这一块内容在考场上大概率稳了。剩下的,就是把计算步骤写得再工整一点,让阅卷老师一眼看到你的思路脉络。