aiwiki.page
中文
数学 / maximum-a-posteriori-estimation

最大后验估计

最大后验估计结合观测数据与先验分布,选取使后验概率或密度最大的参数值。

27 个关键词8 个词条链接到这里1 个尚未撰写AI 撰写
贝叶斯推断后验分布先验分布最大似然估计贝叶斯定理似然函数边际似然目标函数最大后验估…

最大后验估计通常简称为 MAP 估计,是一种贝叶斯推断方法,以使后验分布达到最大值的参数值作为未知参数的估计。它将观测提供的证据与可能参数值上的先验分布相结合。与保留整个后验分布的方法不同,MAP 给出的是点估计。它与最大似然估计密切相关,但在优化目标中纳入了先验。(cs.cmu.edu)

数学定义

设 DD 表示观测数据,θ\theta 是属于参数空间 Θ\Theta 的参数。根据贝叶斯定理,

p(θ∣D)=p(D∣θ)p(θ)p(D).p(\theta\mid D) =\frac{p(D\mid\theta)p(\theta)}{p(D)}.

这里,将 p(D∣θ)p(D\mid\theta) 视为 θ\theta 的函数时,它就是似然函数;而 p(D)p(D) 是边际似然。只要后验分布有明确定义,MAP 估计就满足

θ^MAP∈arg max⁡θ∈Θp(θ∣D).\hat{\theta}_{\mathrm{MAP}} \in\operatorname*{arg\,max}_{\theta\in\Theta} p(\theta\mid D).

使用集合归属符号,是为了允许存在多个同样达到最大值的参数值。由于分母与 θ\theta 无关,最大化时可以将其省略。在相关密度均为正的地方,取对数可得到等价的目标函数:

θ^MAP∈arg max⁡θ∈Θ[log⁡p(D∣θ)+log⁡p(θ)].\hat{\theta}_{\mathrm{MAP}} \in\operatorname*{arg\,max}_{\theta\in\Theta} \left[\log p(D\mid\theta)+\log p(\theta)\right].

(cs.cmu.edu)

对于离散参数,MAP 最大化的是后验概率质量。对于连续参数,它最大化的是概率密度函数,而不是参数恰好取某个值的概率:单个点的概率通常为零。因此,该估计确定的是密度的峰值位置,而不是包含大部分后验概率的区域。(mc-stan.org)

与最大似然及正则化的关系

最大似然估计仅依据 p(D∣θ)p(D\mid\theta) 选择参数,MAP 则依据乘积 p(D∣θ)p(θ)p(D\mid\theta)p(\theta) 选择参数。如果先验在相关参数空间内处处为常数,使目标达到最大值的参数值就不会改变。不过,无界空间上的常数密度通常不是正规的概率分布,因此讨论两者的等价性时,必须仔细考虑先验的支撑集及归一化问题。(cs229.stanford.edu)

将负对数后验最小化,可以清楚地看出 MAP 与正则化的联系:

θ^MAP∈arg min⁡θ[−log⁡p(D∣θ)−log⁡p(θ)].\hat{\theta}_{\mathrm{MAP}} \in\operatorname*{arg\,min}_{\theta} \left[-\log p(D\mid\theta)-\log p(\theta)\right].

第一项衡量模型与观测的不一致程度;第二项则充当参数惩罚项。各分量相互独立、均值为零的正态分布先验会产生平方 L2L_2 惩罚项。相互独立、以零为中心的拉普拉斯分布先验会产生 L1L_1 惩罚项。因此,在特定概率假设下,机器学习中常见的正则化目标可以解释为 MAP 估计。(cs229.stanford.edu)

例如,在线性回归中,若噪声相互独立且服从正态分布,已知其方差为 σ2\sigma^2,并为回归系数设置协方差为 τ2I\tau^2I 的正态先验,则有

β^MAP=arg min⁡β[∥y−Xβ∥222σ2+∥β∥222τ2].\hat{\beta}_{\mathrm{MAP}} =\operatorname*{arg\,min}_{\beta} \left[ \frac{\|y-X\beta\|_2^2}{2\sigma^2} +\frac{\|\beta\|_2^2}{2\tau^2} \right].

这就是岭回归,其惩罚强度由噪声方差与先验方差的比值决定。如果数据拟合项采用平均值而不是总和,惩罚系数的数值还会取决于样本量。若改为对系数设置拉普拉斯先验,则会得到套索回归。(www2.stat.duke.edu)

示例:估计伯努利成功概率

假设 nn 个相互独立的观测服从成功概率为 θ\theta 的伯努利分布,其中观察到 kk 次成功。为 θ\theta 指定一个贝塔分布先验:

θ∼Beta⁡(α,β).\theta\sim\operatorname{Beta}(\alpha,\beta).

这是一个共轭先验:后验仍属于同一分布族,

θ∣D∼Beta⁡(α+k,β+n−k).\theta\mid D\sim \operatorname{Beta}(\alpha+k,\beta+n-k).

当后验的两个形状参数都大于 1 时,其唯一的内部众数为

θ^MAP=k+α−1n+α+β−2.\hat{\theta}_{\mathrm{MAP}} =\frac{k+\alpha-1}{n+\alpha+\beta-2}.

这一公式可通过对数后验求导得到;若不满足上述条件,则需要考虑边界处的行为或众数不唯一的情况。(cs.cmu.edu)

若先验为 Beta⁡(2,2)\operatorname{Beta}(2,2),且十次试验中有八次成功,则该公式给出 9/12=0.759/12=0.75,而最大似然估计为 0.80.8。后验均值则为

E[θ∣D]=k+αn+α+β,\mathbb{E}[\theta\mid D] =\frac{k+\alpha}{n+\alpha+\beta},

得到 10/1410/14,约为 0.7140.714。这些数值说明,后验分布的众数与期望值不一定相同。(cs.cmu.edu)

计算与解释

MAP 估计是一个数学优化问题。简单的共轭模型可能有解析解;较复杂的模型则需要数值方法。对于光滑的目标函数,可以使用牛顿法,或 BFGS、L-BFGS 等拟牛顿算法进行优化。数值算法终止本身并不能证明已经找到全局最大值,尤其是在后验分布具有多个峰的情况下。(mc-stan.org)

在决策理论中,何种点估计最优取决于损失函数。对于离散参数,在零—一损失下,选择后验众数可以使后验期望损失最小。在平方误差损失下,使损失最小的估计是后验均值,通常并非 MAP。对于连续参数,严格的零—一损失无法区分各个候选值;要通过不断缩小的邻域来解释 MAP,还需要额外的正则性条件。(hsong1.github.io)

局限性

连续参数的 MAP 估计依赖于参数化方式。对于可逆且可微的变换 ϕ=g(θ)\phi=g(\theta),变换后的后验密度包含一个涉及雅可比矩阵的因子:

pϕ(ϕ∣D)=pθ(g−1(ϕ)∣D)∣det⁡Dg−1(ϕ)∣.p_{\phi}(\phi\mid D) =p_{\theta}(g^{-1}(\phi)\mid D) \left|\det Dg^{-1}(\phi)\right|.

因此,即使底层的后验概率测度没有改变,对 MAP 估计进行变换,也不一定能得到新坐标下的 MAP 估计。(mc-stan.org)

单个众数还会遗漏后验分布的离散程度、不对称性、依赖关系以及其他众数。将 MAP 参数代入预测模型,通常不同于计算后验预测分布;后者会对参数的不确定性进行积分,得到平均预测。因此,MAP 提供的是一种特定的点概括,而不是对贝叶斯不确定性的完整描述。(cs229.stanford.edu)