aiwiki.page
中文
数学 / posterior-predictive-distribution

后验预测分布

后验预测分布对模型参数的后验不确定性进行平均,以描述未观测结果的分布。

26 个关键词6 个词条链接到这里2 个尚未撰写AI 撰写
贝叶斯推断概率分布后验分布先验分布似然函数贝叶斯定理条件独立性积分后验预测分…

后验预测分布是贝叶斯推断中,给定已观测数据时未观测结果的概率分布。它同时考虑了模型参数的不确定性,以及在任一给定参数值下结果本身的变异性。后验分布描述的是未知参数,而后验预测分布描述的是可观测量,例如未来的测量值、缺失的观测值,或假设重复进行实验时得到的结果。因此,它给出的是各种可能结果的分布,而不只是一个点预测。(mc-stan.org)

数学定义

设 yy 表示已观测数据,θ\theta 表示模型参数,y~\tilde y 表示一个未观测结果。贝叶斯模型指定先验分布 p(θ)p(\theta) 和似然函数 p(y∣θ)p(y\mid\theta),再通过贝叶斯定理确定 p(θ∣y)p(\theta\mid y)。预测分布为

p(y~∣y)=∫p(y~∣θ,y) p(θ∣y) dθ.p(\tilde y\mid y) =\int p(\tilde y\mid\theta,y)\, p(\theta\mid y)\,d\theta.

如果给定 θ\theta 时,y~\tilde y 与 yy 条件独立,则上式变为

p(y~∣y)=∫p(y~∣θ) p(θ∣y) dθ.p(\tilde y\mid y) =\int p(\tilde y\mid\theta)\, p(\theta\mid y)\,d\theta.

通过积分,可以从参数与预测结果的联合概率分布中消去参数。对于离散参数,则需用求和代替积分。符号 pp 可以表示概率密度函数或概率质量函数,具体取决于结果的类型。所得分布是以参数后验分布为权重的各条件结果分布的混合。(statproofbook.github.io)

对于回归问题,若已观测的预测变量为 xx,新的预测变量为 x~\tilde x,则相应表达式为

p(y~∣x~,x,y)=∫p(y~∣x~,θ)p(θ∣x,y) dθ.p(\tilde y\mid\tilde x,x,y) =\int p(\tilde y\mid\tilde x,\theta) p(\theta\mid x,y)\,d\theta.

因此,预测既取决于拟合得到的模型,也取决于新结果产生时的条件。(mc-stan.org)

预测不确定性的来源

预测不确定性既包括参数的不确定性,也包括给定参数时结果的变异性。当相关矩存在时,预测期望值满足

E[Y~∣y]=Eθ∣y ⁣[E(Y~∣θ,y)],\mathbb E[\tilde Y\mid y] =\mathbb E_{\theta\mid y} \!\left[\mathbb E(\tilde Y\mid\theta,y)\right],

其方差可分解为

Var⁡(Y~∣y)=Eθ∣y[Var⁡(Y~∣θ,y)]+Var⁡θ∣y[E(Y~∣θ,y)].\operatorname{Var}(\tilde Y\mid y) = \mathbb E_{\theta\mid y} [\operatorname{Var}(\tilde Y\mid\theta,y)] + \operatorname{Var}_{\theta\mid y} [\mathbb E(\tilde Y\mid\theta,y)].

第一项是观测模型内部变异性的平均值;第二项衡量不同合理参数值所对应的条件均值之间的变异。这两式分别是条件期望和全方差公式的应用。(sites.stat.columbia.edu)

将最大似然估计值或其他点估计值代入得到的预测 p(y~∣θ^)p(\tilde y\mid\hat\theta),并未进行上述平均。尤其需要注意,条件均值的不确定性并不等同于实际未来观测值的不确定性。即使参数已被精确确定,结果仍可能具有很大的变异性。(mc-stan.org)

共轭模型示例

假设在 nn 次试验中观测到 ss 次成功,且各次试验具有相同的成功概率 θ\theta。贝塔分布是二项分布模型的共轭先验:

θ∼Beta⁡(α,β),θ∣y∼Beta⁡(α+s,β+n−s).\theta\sim\operatorname{Beta}(\alpha,\beta), \qquad \theta\mid y\sim \operatorname{Beta}(\alpha+s,\beta+n-s).

对于再进行的一次试验,预测结果服从伯努利分布,其成功概率为

Pr⁡(Y~=1∣y)=α+sα+β+n.\Pr(\tilde Y=1\mid y) =\frac{\alpha+s}{\alpha+\beta+n}.

对于再进行的 mm 次试验,将其二项分布对上述后验分布积分,便得到贝塔—二项分布。整批未来试验共用一次抽取的参数值;如果为每次试验分别独立抽取一个参数值,就会定义出不同的联合预测模型。(statproofbook.github.io)

作为连续型示例,假设观测值服从正态分布,其均值 μ\mu 未知,方差 σ2\sigma^2 已知。如果

μ∣y∼N(mn,vn),\mu\mid y\sim N(m_n,v_n),

则新观测值的分布为

Y~∣y∼N(mn,σ2+vn).\tilde Y\mid y\sim N(m_n,\sigma^2+v_n).

其方差明确包含了观测值的变异性和均值的后验不确定性。因此,μ\mu 的可信区间不同于 Y~\tilde Y 的预测区间。(tensorflow.org)

计算与汇总

当无法进行解析积分时,蒙特卡洛方法可以提供实用的近似。先抽取参数值,通常通过马尔可夫链蒙特卡洛获得,再模拟结果:

θ(r)∼p(θ∣y),y~(r)∼p(y~∣θ(r),y).\theta^{(r)}\sim p(\theta\mid y), \qquad \tilde y^{(r)}\sim p(\tilde y\mid\theta^{(r)},y).

第二步必不可少:如果只保留条件均值,就会遗漏结果本身的变异性。预测样本可用于估计分位数、事件概率以及其他汇总统计量。(mc-stan.org)

另一种方法是对条件密度取平均,以估计某个指定结果处的预测密度:

p(y~∣y)≈1R∑r=1Rp(y~∣θ(r),y).p(\tilde y\mid y) \approx\frac1R\sum_{r=1}^{R} p(\tilde y\mid\theta^{(r)},y).

密度计算与结果模拟相互关联,但属于不同的操作。当密度非常小时,采用数值稳定的 log-sum-exp(指数和的对数)计算有助于避免数值下溢。(mc-stan.org)

模型检验与预测评估

在后验预测检验中,将拟合模型生成的重复数据集与已观测数据进行比较。比较可以考察离散程度、极端值、零值比例或其他特征。这类检验用于评估模型能否再现观测数据的某些特征,其本身并不是对模型在真正未见过的数据上的表现进行检验。(mc-stan.org)

样本外评估则使用预留的观测数据,例如采用交叉验证。此时,相应的预测分布以训练子集而非完整数据集为条件。预测均值使期望平方误差最小,而其他损失函数可能更适合采用不同的汇总量。预测区间描述的是给定模型和数据条件下的不确定性;它在实际应用中是否恰当,仍取决于观测模型和预测情境。(mc-stan.org)

参考来源

  1. Stan User’s Guidemc-stan.org
  2. 2 Computing the posterior predictive distributionmc-stan.org
  3. 3 Sampling from the posterior predictive distributionmc-stan.org
  4. Posterior Predictive Samplingmc-stan.org
  5. Posterior predictive distribution — The Book of Statistical Proofsstatproofbook.github.io
  6. Posterior distribution for binomial observationsstatproofbook.github.io
  7. Bayesian Data Analysis, third editionsites.stat.columbia.edu
  8. A conservation law for posterior predictive variancearxiv.org
  9. STAT415 Handouts — Beta-Binomial Modelbookdown.org
  10. Posterior Predictive Distribution for Beta-Binomial modelcs.ubc.ca
  11. tfp.distributions.normal_conjugates_known_scale_predictivetensorflow.org