定义与数学结构
设 x 表示观测数据,θ 表示未知参数,π(θ∣λ) 是由超参数 λ 确定的先验密度。根据贝叶斯定理,
π(θ∣x,λ)=∫p(x∣ϑ)π(ϑ∣λ)dϑp(x∣θ)π(θ∣λ).
分母是边际似然。如果每次允许的更新都能写成 π(θ∣λ′) 的形式,其中 λ′ 取决于观测数据和原有超参数,那么该先验分布族就是共轭的。因此,后验计算往往可以简化为将分布核相乘,再识别出某个熟悉的概率密度函数。先验与后验的参数值不必相同,而且两者都不必属于描述观测数据的分布族。(stat210a.berkeley.edu)
贝塔—二项共轭关系
假设 S 是 n 次试验中的成功次数,服从成功概率 θ 未知的二项分布。其似然正比于
θS(1−θ)n−S.
参数 α,β 均为正数的贝塔分布,其密度正比于 θα−1(1−θ)β−1。将这两个表达式相乘可得
θ∣S∼Beta(α+S,β+n−S).
同样的更新也适用于一组条件独立、服从伯努利分布的观测值。更新先验超参数时,分别加上成功次数和失败次数即可。(ocw.mit.edu)
当 n>0 时,后验期望值为
E[θ∣S]=α+β+nα+S=α+β+nα+βα+βα+α+β+nnnS.
这表明,该估计是先验均值与观测成功比例的加权平均。在这种基于均值的解释中,α+β 起着先验有效样本量的作用。超参数不必是整数,也不必对应实际的既往观测。(stat210a.berkeley.edu)
例如,若先验为 Beta(2,2),十次试验中有七次成功,则后验为 Beta(9,5),其均值为 9/14,约等于 0.643。这就是更新公式的直接应用。(ocw.mit.edu)
其他常见的共轭配对
对于来自速率参数为 λ 的泊松分布、条件独立的计数 X1,…,Xn,伽马分布先验与之共轭。采用形状参数 a>0 和速率参数 b>0 时,其分布核为 λa−1e−bλ,并且
λ∣x∼Gamma(a+i=1∑nxi, b+n).
这里采用速率参数的约定很重要:若使用尺度参数,更新公式的形式会有所不同。(math.mit.edu)
对于来自均值 μ 未知、方差 σ2 已知的正态分布的观测值,正态先验 μ∼N(m0,v0) 给出
μ∣x∼N(mn,vn),vn−1=v0−1+nσ−2,
mn=vn(v0−1m0+σ−2i=1∑nxi).
后验精度,也就是方差的倒数,等于先验精度与数据精度之和。当均值和方差都未知时,常见的联合共轭分布族包括正态—逆伽马分布,而不是任意选取两个相互独立的先验。(cs.ubc.ca)
与指数族的联系
对于指数族模型,可以采用一种具有广泛适用性的构造方法。将抽样密度写为
p(x∣η)=h(x)exp{η⊤T(x)−A(η)},
其中,η 是自然参数,T(x) 是统计量,A(η) 是对数归一化函数。对于独立观测,∑iT(xi) 是充分统计量。相对于指定的参考测度,η 的共轭先验密度具有如下分布核:
π(η∣χ,ν)∝exp{η⊤χ−νA(η)}.
与似然相乘后,可得加法形式的更新:
χ′=χ+i∑T(xi),ν′=ν+n.
这些公式适用于先验和后验的归一化积分均有限的情形。它们解释了为什么许多常见的共轭更新只需累加计数、总和或其他低维统计量。不过,这种构造并不能保证归一化常数具有初等表达式。(stat.berkeley.edu)
预测与序贯更新
共轭性涉及参数的不确定性,而后验预测分布描述的是未来观测:
p(x∣x)=∫p(x∣θ)π(θ∣x)dθ.
将二项抽样分布对贝塔后验分布积分,会得到贝塔—二项分布。因此,预测分布所属的分布族既不必与后验分布族相同,也不必与原来的抽样分布族相同。(lancaster.ac.uk)
如果给定参数后各观测相互独立,那么逐次更新与使用整个数据集一次性更新是等价的。一批数据更新后得到的后验,会成为下一批数据的先验;可累加的充分统计量使这类更新能够以简洁的形式完成。(ocw.mit.edu)
适用范围与局限
共轭分布族并不唯一:共轭先验的混合分布也可以在更新下保持封闭,只是各分量的参数和混合权重都会改变。它们在数学上的便利,并不能证明其分布形状足以恰当地表达实际的先验信息。当归一化常数难以计算时,共轭性也不能保证计算易于处理。(stat.berkeley.edu)
在多参数模型中,即使难以直接从联合后验分布中抽样,易于处理的全条件分布也可能使吉布斯采样成为可行的方法;吉布斯采样是一种马尔可夫链蒙特卡洛方法。这种条件更新不同于通过一次共轭分布族更新得到完整的联合后验分布。(sites.stat.columbia.edu)