最大似然估计(MLE)是统计学中用于估计统计模型未知参数的一种方法。它选择使观测数据的似然达到最大的参数值:对于离散观测,似然是其联合概率质量;对于连续观测,则是其联合密度。这种方法为拟合概率分布和回归模型提供了统一框架,将统计推断与数学优化联系起来。(web.stanford.edu)
似然及其解释
设 表示观测数据, 是这些数据的联合概率质量函数或联合密度,由属于参数空间 的参数 确定。似然函数为
在似然函数中,数据保持不变,而参数可以变化。任何使似然达到全局最大值的参数值都是一个最大似然估计值,即
在观测之前,将这条规则视为随机数据的函数,它定义的是一个估计量;将其应用于某个具体数据集,则得到一个估计值。似然通常不是参数上的概率分布,因此在 上的积分不必等于一。(web.stanford.edu)
对于独立同分布的观测,联合似然可以分解为各个观测对应项的乘积:
最大似然估计本身并不要求观测相互独立;对于存在依赖关系的观测,需要使用适当的联合模型。对于连续数据,进入似然函数的是密度值,而不是观测恰好落在某一点的概率。(web.stanford.edu)
对数似然与计算
由于对数函数严格递增,最大化正的似然等价于最大化其对数似然:
这样可以将乘积转换为求和,并有助于避免数值下溢。最小化 会得到相同的估计值,因此负对数似然可以用作损失函数。(cs229.stanford.edu)
对于可微模型,参数空间内部的最优解满足得分方程 。解这个方程只能找出候选解:还必须考虑边界以及存在多个驻点的可能性。数值方法包括对负对数似然应用梯度下降,以及使用牛顿法。(web.stanford.edu)
存在未观测变量时,期望最大化算法可以简化似然优化。在高斯混合模型中,该算法交替执行两个步骤:计算各观测属于各个混合分量的后验概率,以及以这些概率为权重更新参数。不同的初始值可能导致不同的局部最优解,而不一定能找到全局最大值。(cs229.stanford.edu)
基础示例
对于来自伯努利分布的独立观测,设 、,且 。则
因此,成功概率的估计值就是观测中的成功比例。如果所有观测均为零或均为一,最大值就在相应的边界处取得,即 或 。(online.stat.psu.edu)
对于来自均值未知、方差为正的正态分布的独立观测,非退化样本给出
这里的方差估计除以的是 ,而不是 。它的期望值为 ,说明最大似然估计量在有限样本下可能存在估计量的偏差。常见的 修正会得到无偏的方差估计量,但它并不是这个模型中的最大似然估计量。(web.stanford.edu)
统计性质
在适当的假设下,包括模型可识别、具有充分的光滑性,以及真实参数位于参数空间内部,最大似然估计具有一致性:随着样本量增加,估计值依概率收敛于真实参数。它还具有渐近正态性。对于标量参数,
其中,单个观测的费舍尔信息为
因此,大样本下的方差近似为 。(web.stanford.edu)
这些结果为近似标准误和置信区间的计算提供了依据。在满足正则条件的模型中,最大似然估计具有渐近有效性,在通常的正则估计量框架下能够达到由信息量决定的下界。这些都是有条件的大样本结果,并不保证无偏性、小样本准确性,也不保证适用于所有模型。(web.stanford.edu)
与机器学习及贝叶斯推断的联系
在误差相互独立、服从高斯分布且方差相同的线性回归中,针对回归系数最大化似然等价于使用普通最小二乘法。在逻辑回归中,最大化条件伯努利似然等价于最小化训练数据上的二元交叉熵。这些联系解释了为什么常见的预测损失具有概率解释。(cs229.stanford.edu)
对于离散数据,最大似然估计也会最小化从经验分布到模型分布的KL散度,因为经验分布的熵不依赖于模型参数。对于连续模型,处理离散经验分布与连续密度之间的关系时需要谨慎:不能简单地将两者的 KL 散度视为同一个有限离散表达式。(cs229.stanford.edu)
与仅依据似然进行估计不同,贝叶斯推断将似然与先验分布结合起来。最大后验估计最大化 ,其中 是先验密度。对系数采用高斯先验会产生二次惩罚项,从而将最大后验估计与正则化联系起来。(cs229.stanford.edu)
解的存在性与模型局限
有限且唯一的最大化解不一定存在。在逻辑回归中,完全分离可能使系数趋向无穷大,而似然则趋近其上确界。不可识别的模型可能使不同参数值对应同一个可观测分布,因此无法唯一确定参数。(stat.umn.edu)
最大似然估计也依赖于模型设定。如果真实分布不属于所选的模型族,在适当的收敛条件下,估计值可能趋近一个“伪真”参数,即使真实分布到该模型族的散度最小的参数。这种收敛并不能证明所假设的模型正确,而且在计算不确定性时必须考虑模型误设。(faculty.washington.edu)