贝塔分布是一族连续概率分布,用于描述取值介于零和一之间的随机变量。它有两个正的形状参数,通常记为 α 和 β,写作 X∼Beta(α,β)。由于取值范围有界且形态多样,贝塔分布适合表示比例以及具有不确定性的概率。尤其是,对于只有两种可能结果的试验,它为成功概率的不确定性提供了便于解析处理的模型。(docs.scipy.org)
定义与分布函数
当 α>0 且 β>0 时,概率密度函数为
f(x;α,β)=B(α,β)xα−1(1−x)β−1,0<x<1,
在单位区间以外则为零。归一化常数为贝塔函数,由下列积分定义:
B(α,β)=∫01tα−1(1−t)β−1dt=Γ(α+β)Γ(α)Γ(β),
其中,Γ 表示伽马函数。因此,对于任意一对正参数,密度函数的积分都等于一。(itl.nist.gov)
累积分布函数为
F(x)=Ix(α,β)=B(α,β)1∫0xtα−1(1−t)β−1dt,0≤x≤1.
这里,Ix 是正则化不完全贝塔函数。一般情况下,分位数没有简单的闭式表达式,需要通过数值方法求得。虽然密度可能在某个端点附近趋于无穷大,但该分布仍然是连续的:零和一这两个点的概率质量均为零。(itl.nist.gov)
分布形态与参数解释
参数决定了概率在区间内的分布方式:
- 当 α=β=1 时,该分布就是 [0,1] 上的均匀分布。
- 当 α,β>1 时,密度在区间内部有唯一的峰。
- 当 0<α,β<1 时,密度呈 U 形,并在趋近两端点时趋于无穷大。
- 当 α≤1 且 β≥1 时,除均匀分布的情形外,密度在整个区间上递减;将这两个不等式的方向反转,则得到递增的密度。
当两个参数相等时,分布关于 1/2 对称。交换参数相当于将密度曲线左右翻转:若 X∼Beta(α,β),则 1−X∼Beta(β,α)。(randomservices.org)
一种实用的替代参数化方式将均值与集中程度分开表示:
μ=α+βα,κ=α+β,
于是 α=μκ,β=(1−μ)κ。固定 μ 时,增大 κ 会降低离散程度,而不改变均值。这可以直接由下文的方差公式得出,有助于区分分布的中心位置与集中程度。(itl.nist.gov)
矩与尺度变换
期望值和方差分别为
E[X]=α+βα,Var(X)=(α+β)2(α+β+1)αβ=κ+1μ(1−μ).
当两个形状参数都大于一时,众数为
α+β−2α−1.
这些公式描述的是单位区间上的标准贝塔分布。(itl.nist.gov)
通过令 Y=a+(b−a)X,可以将贝塔随机变量变换到任意有限区间 [a,b] 上,其中 a<b。其密度变为
fY(y)=b−a1f(b−ay−a;α,β).
因此,其均值为 a+(b−a)E[X],方差为 (b−a)2Var(X)。区间端点额外规定了位置和尺度,并不能替代两个形状参数。(docs.scipy.org)
贝叶斯推断
在贝叶斯推断中,贝塔先验分布是伯努利分布模型或二项分布模型中成功概率 p 的共轭先验。假设在给定 p 的条件下,n 次试验相互独立,并观测到 s 次成功。似然函数与 ps(1−p)n−s 成正比。根据贝叶斯定理,将似然函数与贝塔先验相乘,可得到后验分布
p∣s,n∼Beta(α+s,β+n−s).
因此,每次成功使第一个参数增加一,每次失败使第二个参数增加一。(mas.ncl.ac.uk)
后验均值为
E[p∣s,n]=α+β+nα+s.
当 n>0 时,它可以写成先验均值与观测成功比例的加权平均:
α+β+nα+βα+βα+α+β+nnns.
这一代数关系说明了为什么可以将 α+β 解释为先验集中度或有效权重参数。形状参数不必是整数,也不必对应实际的历史观测次数。例如,Beta(2,2) 先验在观测到八次成功和两次失败后,会更新为 Beta(10,4),后验均值为 5/7。(mas.ncl.ac.uk)
相关分布与参数估计
贝塔分布可以由伽马分布构造。若 G1 与 G2 满足统计独立性,形状参数分别为 α,β,且具有相同的正速率参数,则
G1+G2G1∼Beta(α,β).
这一关系提供了一种生成贝塔随机变量的构造方法。(randomservices.org)
贝塔分布还可以描述次序统计量:对于 n 个相互独立、服从 [0,1] 上均匀分布的随机变量,按观测值从小到大排列后的第 k 个值服从 Beta(k,n−k+1) 分布。因此,贝塔分布不仅是为有界数据选用的模型,也自然出现在排序后观测值的抽样分布中。(math.arizona.edu)
狄利克雷分布将贝塔分布族推广到由正比例组成、各分量之和为一的向量。当向量只有两个分量时,第一个分量服从贝塔分布,第二个分量则等于一减去第一个分量。(docs.scipy.org)
对于严格介于零和一之间的观测值,最大似然估计通过求解非线性方程来确定形状参数,通常需要采用数值方法。如果区间端点也可以自由估计,那么当拟合端点趋近于极端观测值时,似然可能变得无界;因此,固定区间端点与自由估计区间端点会导致差异显著的拟合问题。(itl.nist.gov)