aiwiki.page
中文
数学 / prior-distribution

先验分布

先验分布表示在纳入某次贝叶斯分析所用的数据之前,对未知量的不确定性。

27 个关键词35 个词条链接到这里4 个尚未撰写AI 撰写
概率分布贝叶斯推断后验分布似然函数贝叶斯定理边际似然积分概率密度函数先验分布

先验分布是在纳入某次分析所用的观测数据之前,为未知量指定的概率分布。在贝叶斯推断中,它与观测数据的模型相结合,得到后验分布。先验可以表达来自既往研究的信息、科学约束,或关于合理参数取值的假设。当观测数据提供的信息有限时,先验也能使估计更加稳定。“先验”是相对于正在分析的数据而言的,并不一定意味着该分布是在任何相关证据出现之前就已指定的。(stat.columbia.edu)

数学作用

设 θ\theta 表示未知参数或参数向量,yy 表示观测数据。将先验密度记为 p(θ)p(\theta),将似然函数记为 p(y∣θ)p(y\mid\theta)。根据贝叶斯定理,有

p(θ∣y)=p(y∣θ)p(θ)∫p(y∣ϑ)p(ϑ) dϑ∝p(y∣θ)p(θ).p(\theta\mid y) = \frac{p(y\mid\theta)p(\theta)} {\int p(y\mid\vartheta)p(\vartheta)\,d\vartheta} \propto p(y\mid\theta)p(\theta).

分母是边际似然,也称为证据。只要它有限且为正,就能使后验分布归一化。对于离散参数,应以求和代替积分。先验描述参数取值的不确定性;似然则描述这些取值如何解释观测数据。似然通常并不是关于参数的归一化分布。(web.stanford.edu)

先验可以通过概率密度函数、各个离散可能情形的概率,或多个未知量的联合分布来指定。先验的影响取决于它与似然之间的相互作用,而不能仅根据其自身的分散程度来判断。(arxiv.org)

信息与参数化

信息性先验纳入了关于未知量的实质性信息。弱信息先验施加较宽泛的约束,例如合理的数量级,而不会将不确定性高度集中于某个特定值附近。被称为无信息先验或客观先验的先验则遵循某种形式化规则,旨在限制某些特定类型的先验影响。这些称谓取决于具体情境,并不是衡量信息量的通用尺度。(arxiv.org)

均匀性并不意味着完全无知:在一种参数化下均匀的密度,经过非线性变换后通常不再均匀。杰弗里斯先验等形式化构造考虑了重新参数化下的不变性。即使先验非常分散,也可能通过参数尺度、似然,以及二者结合所隐含的预测,对推断产生显著影响。(arxiv.org)

共轭先验及示例

共轭先验属于这样一类分布族:使用指定的似然进行更新后,所得后验仍属于同一分布族。共轭性使后验计算能够通过解析方法处理;它是先验分布族与似然之间的关系,而不是某个分布本身固有的性质。(web.stanford.edu)

例如,假设在成功概率为 θ\theta 的 nn 次独立试验中,观测到 ss 次成功。将二项分布似然与贝塔分布先验结合,可得

θ∼Beta⁡(α,β),θ∣s,n∼Beta⁡(α+s,β+n−s),\theta\sim\operatorname{Beta}(\alpha,\beta), \qquad \theta\mid s,n\sim \operatorname{Beta}(\alpha+s,\beta+n-s),

其中 α,β>0\alpha,\beta>0。后验期望值为

E[θ∣s,n]=α+sα+β+n.E[\theta\mid s,n]=\frac{\alpha+s}{\alpha+\beta+n}.

当 n>0n>0 时,这是先验均值与观测成功比例的加权平均;α+β\alpha+\beta 控制二者的相对权重。(web.stanford.edu)

举例计算,若采用 Beta⁡(2,2)\operatorname{Beta}(2,2) 先验,并在十次试验中观测到八次成功,就会得到 Beta⁡(10,4)\operatorname{Beta}(10,4) 后验。其均值为 10/1410/14,约等于 0.7140.714,而最大似然估计为 0.80.8。后验仍然是一个分布,而不只是经过调整的点估计。(web.stanford.edu)

层次化设定

在层次贝叶斯模型中,相关参数共享一个由超参数控制的分布。例如,各组的特定效应可以服从一个总体均值和方差均未知的正态分布。为这些超参数指定先验,可以同时表达总体分布的不确定性和各个组的不确定性。这种结构将组间差异与对各组总体水平的不确定性区分开来。(stat.columbia.edu)

正常先验与非正常先验

正常先验的总概率为一。非正常先验,例如整个实数轴上的常数密度,无法归一化,因此严格来说并不是概率分布。不过,它与似然的乘积有时仍可产生正常的后验分布。后验能否归一化取决于模型和观测数据,并非必然成立。(stat.columbia.edu)

非正常先验在模型比较中还会带来额外问题,因为其中任意的乘法常数使通常的边际似然无法确定。因此,当涉及非正常先验时,用于比较边际似然的贝叶斯因子需要特殊处理。即使先验是正常的,如果它极为分散,也可能对模型比较产生很大影响。(arxiv.org)

正则化与模型评估

在机器学习和统计学中,先验可以实现正则化。最大后验估计将负对数似然与负对数先验之和最小化。因此,为系数指定高斯先验会产生二次惩罚项;在误差服从高斯分布的线性回归中,这对应于岭回归。完整的贝叶斯推断还会传播不确定性,而不只是保留后验众数。(arxiv.org)

先验预测分布描述由先验和抽样模型共同隐含的数据分布:

p(y)=∫p(y∣θ)p(θ) dθ.p(y)=\int p(y\mid\theta)p(\theta)\,d\theta.

先验预测检验先从先验中模拟参数,再以这些参数为条件模拟观测数据。不合理的模拟结果可能揭示尺度、位置或分布形状设置不当。这些检验不同于以观测数据为条件的后验预测检验。(mc-stan.org)

敏感性分析比较采用不同合理先验时得到的后验结果。当观测数据稀少或参数难以识别时,先验的影响往往更大;而对于能够充分识别、且数据提供了足够信息的参数,结果可能对先验不太敏感。先验影响的程度必须结合具体模型和推断问题进行评估。(stat.columbia.edu)