似然函数是统计模型参数的函数:它将观测数据固定,通过计算不同参数值下这些数据的概率质量或概率密度来定义。似然函数是统计学的基础概念,为参数估计、模型比较和不确定性评估提供依据。与描述各种可能观测结果的概率分布不同,似然函数改变的是参数,而不是数据。其核心在于比较:在给定模型中,似然值越高的参数值,赋予观测数据的概率质量或概率密度就越大。(online.stat.psu.edu)
定义与解释
设 (X) 表示一个随机变量或数据向量,(\theta\in\Theta) 表示模型的参数,也可以是参数向量。如果 (f(x;\theta)) 描述抽样分布,那么在观测到 (X=x) 后,似然函数为
[ L(\theta;x)=f(x;\theta). ]
对于离散数据,(f) 是概率质量函数;对于连续数据,它是概率密度函数。因此,同一个数学表达式既可以描述抽样分布,也可以描述似然函数,区别在于允许哪个自变量变化。(online.stat.psu.edu)
似然函数通常不是关于 (\theta) 的概率分布:它在参数空间上的求和或积分不必等于一。对于连续观测,似然函数计算的是密度,而不是恰好观测到某一点的概率;后者通常为零。基于密度的似然值可以大于一。由于这些区别,不能直接将 (L(\theta;x)) 解释为 (\theta) 正确的概率。要得到参数的概率分布,还需要额外的假设,例如贝叶斯推断中所作的假设。(arxiv.org)
构造样本似然函数
多个观测值的似然函数由它们的联合概率分布决定。如果产生 (x_1,\ldots,x_n) 的各次观测具有统计独立性,并且具有相同的抽样密度函数或概率质量函数,那么
[ L(\theta;x_1,\ldots,x_n) =\prod_{i=1}^{n}f(x_i;\theta). ]
这一乘积公式依赖于独立性假设;对于相依的观测,需要使用适当的联合模型。只要观测相互独立,即使其分布不相同,似然函数也可以写成乘积形式。(online.stat.psu.edu)
例如,假设 (n) 次独立试验均服从成功概率为 (p) 的伯努利分布。如果观测到的序列中有 (k) 次成功,其似然函数为
[ L(p)=p^k(1-p)^{n-k},\qquad 0\le p\le1. ]
如果只记录成功次数,则由其二项分布得到似然函数 [ L_{\mathrm{count}}(p)=\binom nk p^k(1-p)^{n-k}. ] 二项式系数不依赖于 (p),因此两个似然函数在相同的参数值处取得最大值。更一般地,将似然函数乘以一个与参数无关的正因子,不会改变不同参数值之间的似然比,也不会改变使似然函数取得最大值的参数值。(online.stat.psu.edu)
对数似然与估计
对数似然定义为
[ \ell(\theta)=\log L(\theta). ]
由于对数函数严格递增,最大化取正值的似然函数等价于最大化其对数。乘积也因此转化为求和: [ \ell(\theta)=\sum_{i=1}^{n}\log f(x_i;\theta). ] 这简化了求导和数值计算。最大似然估计选取 [ \hat\theta\in\operatorname*{arg,max}_{\theta\in\Theta}\ell(\theta). ] 在上述伯努利分布的例子中,当 (n>0) 时,(\hat p=k/n);当所有试验结果都相同时,这一结果也包含位于参数空间边界上的解。(itl.nist.gov)
求最大值是一个数学优化问题。令导数为零可以找出参数空间内部的候选点,但仅凭这一点并不能确定全局最大值。约束条件、边界值以及多个驻点都可能影响结果。有些模型不存在使似然函数取得最大值的有限参数值,数值算法也可能无法收敛。这些都是模型和优化问题本身的性质,并不意味着似然的定义发生了变化。(itl.nist.gov)
曲率与统计推断
对数似然的梯度称为得分。在满足适当的可微性条件和正则条件时,费希尔信息可以表示为对数似然的负二阶导数的期望;对于参数向量,则是负海森矩阵的期望。它量化了模型中的观测所提供的参数信息。(arxiv.org)
在性质良好的最大值点附近,对数似然的曲率有助于近似计算估计量的方差,并构造置信区间。在满足正则条件且模型设定正确的情况下,大样本中的最大似然估计量近似服从正态分布,其协方差与费希尔信息的逆有关。这些近似并非普遍适用,尤其是在参数位于边界或模型不满足正则条件时。(arxiv.org)
似然还可用于统计假设检验。对于受限参数空间 (\Theta_0\subseteq\Theta),似然比统计量比较的是 [ \Lambda= \frac{\sup_{\theta\in\Theta_0}L(\theta)} {\sup_{\theta\in\Theta}L(\theta)}. ] 较小的值表明,在该约束下模型的拟合较差。在适当的正则条件下,(-2\log\Lambda) 渐近服从卡方分布,其自由度对应于独立约束的个数。(itl.nist.gov)
贝叶斯推断与机器学习
在贝叶斯推断中,贝叶斯定理将似然函数与先验分布 (\pi(\theta)) 相结合,得到后验分布: [ \pi(\theta\mid x)= \frac{L(\theta;x)\pi(\theta)} {\int_\Theta L(u;x)\pi(u),du}, ] 前提是分母有限且为正。这个分母称为边际似然。后验分布同时包含抽样模型和先验分布的信息,而似然函数本身并不包含先验信息。(online.stat.psu.edu)
在机器学习中,负对数似然经常被用作损失函数。对于类别预测,它给出常见的交叉熵目标函数。在误差相互独立、服从高斯分布且方差恒定的线性回归中,关于回归系数最大化似然函数,等价于最小化平方误差。这些等价关系取决于所假设的概率模型。(web.stanford.edu)