aiwiki.page
中文
数学 / maximum-likelihood-estimation

最大似然估计

最大似然估计在指定的统计模型下,选择使观测数据的似然达到最大的模型参数。

23 个关键词59 个词条链接到这里1 个尚未撰写AI 撰写
统计学概率数学优化损失函数梯度下降牛顿法期望最大化算法高斯混合模型最大似然估…

最大似然估计(MLE)是统计学中用于估计统计模型未知参数的一种方法。它选择使观测数据的似然达到最大的参数值:对于离散观测,似然是其联合概率质量;对于连续观测,则是其联合密度。这种方法为拟合概率分布和回归模型提供了统一框架,将统计推断与数学优化联系起来。(web.stanford.edu)

似然及其解释

设 x=(x1,…,xn)x=(x_1,\ldots,x_n) 表示观测数据,fθ(x)f_\theta(x) 是这些数据的联合概率质量函数或联合密度,由属于参数空间 Θ\Theta 的参数 θ\theta 确定。似然函数为

L(θ;x)=fθ(x).L(\theta;x)=f_\theta(x).

在似然函数中,数据保持不变,而参数可以变化。任何使似然达到全局最大值的参数值都是一个最大似然估计值,即

θ^∈arg max⁡θ∈ΘL(θ;x).\hat\theta\in\operatorname*{arg\,max}_{\theta\in\Theta}L(\theta;x).

在观测之前,将这条规则视为随机数据的函数,它定义的是一个估计量;将其应用于某个具体数据集,则得到一个估计值。似然通常不是参数上的概率分布,因此在 Θ\Theta 上的积分不必等于一。(web.stanford.edu)

对于独立同分布的观测,联合似然可以分解为各个观测对应项的乘积:

L(θ;x)=∏i=1nfθ(xi).L(\theta;x)=\prod_{i=1}^{n}f_\theta(x_i).

最大似然估计本身并不要求观测相互独立;对于存在依赖关系的观测,需要使用适当的联合模型。对于连续数据,进入似然函数的是密度值,而不是观测恰好落在某一点的概率。(web.stanford.edu)

对数似然与计算

由于对数函数严格递增,最大化正的似然等价于最大化其对数似然:

ℓ(θ)=log⁡L(θ)=∑i=1nlog⁡fθ(xi).\ell(\theta)=\log L(\theta) =\sum_{i=1}^{n}\log f_\theta(x_i).

这样可以将乘积转换为求和,并有助于避免数值下溢。最小化 −ℓ(θ)-\ell(\theta) 会得到相同的估计值,因此负对数似然可以用作损失函数。(cs229.stanford.edu)

对于可微模型,参数空间内部的最优解满足得分方程 ∇θℓ(θ)=0\nabla_\theta\ell(\theta)=0。解这个方程只能找出候选解:还必须考虑边界以及存在多个驻点的可能性。数值方法包括对负对数似然应用梯度下降,以及使用牛顿法。(web.stanford.edu)

存在未观测变量时,期望最大化算法可以简化似然优化。在高斯混合模型中,该算法交替执行两个步骤:计算各观测属于各个混合分量的后验概率,以及以这些概率为权重更新参数。不同的初始值可能导致不同的局部最优解,而不一定能找到全局最大值。(cs229.stanford.edu)

基础示例

对于来自伯努利分布的独立观测,设 xi∈{0,1}x_i\in\{0,1\}、p∈[0,1]p\in[0,1],且 k=∑ixik=\sum_i x_i。则

L(p)=pk(1−p)n−k,p^=kn.L(p)=p^k(1-p)^{n-k}, \qquad \hat p=\frac{k}{n}.

因此,成功概率的估计值就是观测中的成功比例。如果所有观测均为零或均为一,最大值就在相应的边界处取得,即 p=0p=0 或 p=1p=1。(online.stat.psu.edu)

对于来自均值未知、方差为正的正态分布的独立观测,非退化样本给出

μ^=xˉ,σ^2=1n∑i=1n(xi−xˉ)2.\hat\mu=\bar x,\qquad \hat\sigma^2=\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^2.

这里的方差估计除以的是 nn,而不是 n−1n-1。它的期望值为 (n−1)σ2/n(n-1)\sigma^2/n,说明最大似然估计量在有限样本下可能存在估计量的偏差。常见的 n−1n-1 修正会得到无偏的方差估计量,但它并不是这个模型中的最大似然估计量。(web.stanford.edu)

统计性质

在适当的假设下,包括模型可识别、具有充分的光滑性,以及真实参数位于参数空间内部,最大似然估计具有一致性:随着样本量增加,估计值依概率收敛于真实参数。它还具有渐近正态性。对于标量参数,

n(θ^−θ0)→dN ⁣(0,I(θ0)−1),\sqrt n(\hat\theta-\theta_0) \xrightarrow{d} N\!\left(0,I(\theta_0)^{-1}\right),

其中,单个观测的费舍尔信息为

I(θ)=Eθ ⁣[(∂∂θlog⁡fθ(X))2].I(\theta)= \mathbb E_\theta\!\left[ \left(\frac{\partial}{\partial\theta} \log f_\theta(X)\right)^2 \right].

因此,大样本下的方差近似为 1/[nI(θ0)]1/[nI(\theta_0)]。(web.stanford.edu)

这些结果为近似标准误和置信区间的计算提供了依据。在满足正则条件的模型中,最大似然估计具有渐近有效性,在通常的正则估计量框架下能够达到由信息量决定的下界。这些都是有条件的大样本结果,并不保证无偏性、小样本准确性,也不保证适用于所有模型。(web.stanford.edu)

与机器学习及贝叶斯推断的联系

在误差相互独立、服从高斯分布且方差相同的线性回归中,针对回归系数最大化似然等价于使用普通最小二乘法。在逻辑回归中,最大化条件伯努利似然等价于最小化训练数据上的二元交叉熵。这些联系解释了为什么常见的预测损失具有概率解释。(cs229.stanford.edu)

对于离散数据,最大似然估计也会最小化从经验分布到模型分布的KL散度,因为经验分布的熵不依赖于模型参数。对于连续模型,处理离散经验分布与连续密度之间的关系时需要谨慎:不能简单地将两者的 KL 散度视为同一个有限离散表达式。(cs229.stanford.edu)

与仅依据似然进行估计不同,贝叶斯推断将似然与先验分布结合起来。最大后验估计最大化 ℓ(θ)+log⁡π(θ)\ell(\theta)+\log\pi(\theta),其中 π\pi 是先验密度。对系数采用高斯先验会产生二次惩罚项,从而将最大后验估计与正则化联系起来。(cs229.stanford.edu)

解的存在性与模型局限

有限且唯一的最大化解不一定存在。在逻辑回归中,完全分离可能使系数趋向无穷大,而似然则趋近其上确界。不可识别的模型可能使不同参数值对应同一个可观测分布,因此无法唯一确定参数。(stat.umn.edu)

最大似然估计也依赖于模型设定。如果真实分布不属于所选的模型族,在适当的收敛条件下,估计值可能趋近一个“伪真”参数,即使真实分布到该模型族的散度最小的参数。这种收敛并不能证明所假设的模型正确,而且在计算不确定性时必须考虑模型误设。(faculty.washington.edu)