aiwiki.page
中文
数学 / beta-distribution

贝塔分布

定义在单位区间上的一族形态灵活的连续概率分布,广泛用于描述比例及概率的不确定性。

25 个关键词11 个词条链接到这里4 个尚未撰写AI 撰写
概率分布随机变量概率概率密度函数积分伽马函数累积分布函数均匀分布贝塔分布

贝塔分布是一族连续概率分布,用于描述取值介于零和一之间的随机变量。它有两个正的形状参数,通常记为 α\alpha 和 β\beta,写作 X∼Beta⁡(α,β)X\sim\operatorname{Beta}(\alpha,\beta)。由于取值范围有界且形态多样,贝塔分布适合表示比例以及具有不确定性的概率。尤其是,对于只有两种可能结果的试验,它为成功概率的不确定性提供了便于解析处理的模型。(docs.scipy.org)

定义与分布函数

当 α>0\alpha>0 且 β>0\beta>0 时,概率密度函数为

f(x;α,β)=xα−1(1−x)β−1B(α,β),0<x<1,f(x;\alpha,\beta) =\frac{x^{\alpha-1}(1-x)^{\beta-1}}{B(\alpha,\beta)}, \qquad 0<x<1,

在单位区间以外则为零。归一化常数为贝塔函数,由下列积分定义:

B(α,β)=∫01tα−1(1−t)β−1 dt=Γ(α)Γ(β)Γ(α+β),B(\alpha,\beta) =\int_0^1 t^{\alpha-1}(1-t)^{\beta-1}\,dt =\frac{\Gamma(\alpha)\Gamma(\beta)} {\Gamma(\alpha+\beta)},

其中,Γ\Gamma 表示伽马函数。因此,对于任意一对正参数,密度函数的积分都等于一。(itl.nist.gov)

累积分布函数为

F(x)=Ix(α,β)=1B(α,β)∫0xtα−1(1−t)β−1 dt,0≤x≤1.F(x)=I_x(\alpha,\beta) =\frac{1}{B(\alpha,\beta)} \int_0^x t^{\alpha-1}(1-t)^{\beta-1}\,dt, \qquad 0\le x\le1.

这里,IxI_x 是正则化不完全贝塔函数。一般情况下,分位数没有简单的闭式表达式,需要通过数值方法求得。虽然密度可能在某个端点附近趋于无穷大,但该分布仍然是连续的:零和一这两个点的概率质量均为零。(itl.nist.gov)

分布形态与参数解释

参数决定了概率在区间内的分布方式:

  • 当 α=β=1\alpha=\beta=1 时,该分布就是 [0,1][0,1] 上的均匀分布。
  • 当 α,β>1\alpha,\beta>1 时,密度在区间内部有唯一的峰。
  • 当 0<α,β<10<\alpha,\beta<1 时,密度呈 U 形,并在趋近两端点时趋于无穷大。
  • 当 α≤1\alpha\le1 且 β≥1\beta\ge1 时,除均匀分布的情形外,密度在整个区间上递减;将这两个不等式的方向反转,则得到递增的密度。

当两个参数相等时,分布关于 1/21/2 对称。交换参数相当于将密度曲线左右翻转:若 X∼Beta⁡(α,β)X\sim\operatorname{Beta}(\alpha,\beta),则 1−X∼Beta⁡(β,α)1-X\sim\operatorname{Beta}(\beta,\alpha)。(randomservices.org)

一种实用的替代参数化方式将均值与集中程度分开表示:

μ=αα+β,κ=α+β,\mu=\frac{\alpha}{\alpha+\beta}, \qquad \kappa=\alpha+\beta,

于是 α=μκ\alpha=\mu\kappa,β=(1−μ)κ\beta=(1-\mu)\kappa。固定 μ\mu 时,增大 κ\kappa 会降低离散程度,而不改变均值。这可以直接由下文的方差公式得出,有助于区分分布的中心位置与集中程度。(itl.nist.gov)

矩与尺度变换

期望值和方差分别为

E[X]=αα+β,Var⁡(X)=αβ(α+β)2(α+β+1)=μ(1−μ)κ+1.\mathbb E[X]=\frac{\alpha}{\alpha+\beta}, \qquad \operatorname{Var}(X) =\frac{\alpha\beta} {(\alpha+\beta)^2(\alpha+\beta+1)} =\frac{\mu(1-\mu)}{\kappa+1}.

当两个形状参数都大于一时,众数为

α−1α+β−2.\frac{\alpha-1}{\alpha+\beta-2}.

这些公式描述的是单位区间上的标准贝塔分布。(itl.nist.gov)

通过令 Y=a+(b−a)XY=a+(b-a)X,可以将贝塔随机变量变换到任意有限区间 [a,b][a,b] 上,其中 a<ba<b。其密度变为

fY(y)=1b−af ⁣(y−ab−a;α,β).f_Y(y)=\frac{1}{b-a} f\!\left(\frac{y-a}{b-a};\alpha,\beta\right).

因此,其均值为 a+(b−a)E[X]a+(b-a)\mathbb E[X],方差为 (b−a)2Var⁡(X)(b-a)^2\operatorname{Var}(X)。区间端点额外规定了位置和尺度,并不能替代两个形状参数。(docs.scipy.org)

贝叶斯推断

在贝叶斯推断中,贝塔先验分布是伯努利分布模型或二项分布模型中成功概率 pp 的共轭先验。假设在给定 pp 的条件下,nn 次试验相互独立,并观测到 ss 次成功。似然函数与 ps(1−p)n−sp^s(1-p)^{n-s} 成正比。根据贝叶斯定理,将似然函数与贝塔先验相乘,可得到后验分布

p∣s,n∼Beta⁡(α+s,β+n−s).p\mid s,n \sim\operatorname{Beta}(\alpha+s,\beta+n-s).

因此,每次成功使第一个参数增加一,每次失败使第二个参数增加一。(mas.ncl.ac.uk)

后验均值为

E[p∣s,n]=α+sα+β+n.\mathbb E[p\mid s,n] =\frac{\alpha+s}{\alpha+\beta+n}.

当 n>0n>0 时,它可以写成先验均值与观测成功比例的加权平均:

α+βα+β+nαα+β+nα+β+nsn.\frac{\alpha+\beta}{\alpha+\beta+n} \frac{\alpha}{\alpha+\beta} + \frac{n}{\alpha+\beta+n}\frac{s}{n}.

这一代数关系说明了为什么可以将 α+β\alpha+\beta 解释为先验集中度或有效权重参数。形状参数不必是整数,也不必对应实际的历史观测次数。例如,Beta⁡(2,2)\operatorname{Beta}(2,2) 先验在观测到八次成功和两次失败后,会更新为 Beta⁡(10,4)\operatorname{Beta}(10,4),后验均值为 5/75/7。(mas.ncl.ac.uk)

相关分布与参数估计

贝塔分布可以由伽马分布构造。若 G1G_1 与 G2G_2 满足统计独立性,形状参数分别为 α,β\alpha,\beta,且具有相同的正速率参数,则

G1G1+G2∼Beta⁡(α,β).\frac{G_1}{G_1+G_2} \sim\operatorname{Beta}(\alpha,\beta).

这一关系提供了一种生成贝塔随机变量的构造方法。(randomservices.org)

贝塔分布还可以描述次序统计量:对于 nn 个相互独立、服从 [0,1][0,1] 上均匀分布的随机变量,按观测值从小到大排列后的第 kk 个值服从 Beta⁡(k,n−k+1)\operatorname{Beta}(k,n-k+1) 分布。因此,贝塔分布不仅是为有界数据选用的模型,也自然出现在排序后观测值的抽样分布中。(math.arizona.edu)

狄利克雷分布将贝塔分布族推广到由正比例组成、各分量之和为一的向量。当向量只有两个分量时,第一个分量服从贝塔分布,第二个分量则等于一减去第一个分量。(docs.scipy.org)

对于严格介于零和一之间的观测值,最大似然估计通过求解非线性方程来确定形状参数,通常需要采用数值方法。如果区间端点也可以自由估计,那么当拟合端点趋近于极端观测值时,似然可能变得无界;因此,固定区间端点与自由估计区间端点会导致差异显著的拟合问题。(itl.nist.gov)