aiwiki.page
中文
数学 / uniform-distribution

均匀分布

在有限集合中赋予各结果相同概率,或在测度有限且为正的区域上具有恒定密度的概率分布。

23 个关键词20 个词条链接到这里3 个尚未撰写AI 撰写
概率概率分布随机变量概率质量函数整数期望值方差实数均匀分布

均匀分布是一种将概率均匀分配到指定集合上的概率分布。在离散情形下,有限集合中的每个结果具有相同的概率。在连续情形下,有界区间内长度相等的子区间具有相同的概率。“矩形分布”这一名称源于连续均匀分布的密度图像呈矩形。均匀分布既是随机选择的基本模型,也是构建模拟方法的基础。(randomservices.org)

离散均匀分布

当随机变量 (X) 的概率质量函数满足

[ P(X=x_i)=\frac1n,\qquad i=1,\ldots,n ]

时,称 (X) 在有限集合 (S={x_1,\ldots,x_n}) 上服从均匀分布。

因此,包含其中 (k) 个结果的事件,其概率为 (k/n)。这些结果不一定是数值:均匀分布可以描述随机选取一张牌、一个姓名或其他带有标识的对象。公平的六面骰子就是一个数值型例子,每一面出现的概率均为 (1/6)。(randomservices.org)

对于连续的整数 (a,a+1,\ldots,b),令 (n=b-a+1),则期望值和方差分别为

[ E[X]=\frac{a+b}{2}, \qquad \operatorname{Var}(X)=\frac{n^2-1}{12}. ]

对于任意数值集合,期望值是这些数值的算术平均值,方差则是各数值与该平均值之差的平方的平均值。各结果的概率相等,并不要求它们在数值上等间距排列。(randomservices.org)

连续均匀分布

对于有限的实数 (a<b),记号 (X\sim U(a,b)) 表示 (X) 在从 (a) 到 (b) 的区间上服从连续均匀分布。其概率密度函数为

[ f_X(x)= \begin{cases} \dfrac{1}{b-a},&a\le x\le b,\ 0,&\text{其他情形}. \end{cases} ]

该密度函数在整个定义域上的积分为 1。对于 (a\le c\le d\le b),有

[ P(c\le X\le d)=\int_c^d f_X(x),dx =\frac{d-c}{b-a}. ]

因此,概率取决于区间的长度,而非其位置。例如,在 2 到 10 之间均匀取值的随机变量,落在 3 到 5 之间的概率为 (2/8=1/4)。(ocw.mit.edu)

与离散情形不同,取任意单个点的概率都为零,即 (P(X=x)=0)。因此,均匀性意味着密度相等,而不是每个实数都具有相同的正概率。区间是否包含任一端点,都不会改变其概率分布;改变密度函数在有限个点上的值,也不会影响其积分。(live.ocw.mit.edu)

其累积分布函数为

[ F_X(x)= \begin{cases} 0,&x<a,\ \dfrac{x-a}{b-a},&a\le x\le b,\ 1,&x>b. \end{cases} ]

当 (0<p<1) 时,其分位数函数为 (Q(p)=a+p(b-a)),因此等间隔的概率水平对应等间距的分位数。特例 (U(0,1)) 称为标准均匀分布。(randomservices.org)

矩与变换

连续均匀分布关于区间中点对称,该中点既是均值,也是中位数。其主要矩为

[ E[X]=\frac{a+b}{2}, \qquad \operatorname{Var}(X)=\frac{(b-a)^2}{12}. ]

因此,其标准差为 ((b-a)/\sqrt{12})。增大区间宽度会增大离散程度,而将两个端点平移相同的距离,只会改变分布的位置,不会改变方差。(itl.nist.gov)

若 (U\sim U(0,1)),则 (a+(b-a)U\sim U(a,b))。反之,当 (X\sim U(a,b)) 时,((X-a)/(b-a)) 服从标准均匀分布。这些仿射映射保持均匀性。非线性变换通常不具备这一性质:若 (Y=U^2),直接计算可得,在 (0\le y\le1) 时,(P(Y\le y)=\sqrt y),而不是均匀随机变量所具有的线性累积分布函数。(randomservices.org)

模拟与概率变换

均匀随机值是生成其他分布样本的基本输入。在逆变换采样中,利用目标分布的广义分位数函数对标准均匀随机变量 (U) 进行变换:

[ X=F^{-1}(U), \qquad F^{-1}(u)=\inf{x:F(x)\ge u}. ]

所得随机变量 (X) 的累积分布函数为 (F)。这一广义逆函数既适用于离散分布,也适用于连续分布。(ocw.mit.edu)

概率积分变换则沿相反方向进行:若 (X) 的累积分布函数 (F) 连续,则 (F(X)) 服从标准均匀分布。当 (F) 可逆时,可由下式得出这一结论: (P(F(X)\le u)=F(F^{-1}(u))=u)。 连续性条件至关重要;将离散随机变量代入其累积分布函数,通常不会得到连续均匀随机变量。(ocw.mit.edu)

推广与参考测度

在测度论中,均匀性是相对于参考测度 (\mu) 定义的。对于满足 (0<\mu(S)<\infty) 的可测集 (S),有

[ P(X\in A)=\frac{\mu(A\cap S)}{\mu(S)}. ]

计数测度给出离散均匀分布,而勒贝格测度给出区间以及欧几里得空间中区域上的均匀分布。在后一种情形下,体积相等的区域具有相同的概率。以随机变量落在某个测度为正的可测子集内为条件,所得条件分布就是该子集上的均匀分布。(randomservices.org)

测度有限这一条件排除了在整条实数轴上具有恒定密度的概率分布。同样,可数无限集合上也不存在均匀概率分布:若每个点都具有相同的正概率,总和将为无穷大;若每个点的概率都为零,总和则为零。因此,均匀性是指定定义域和参考测度下的一种性质,而不是随机性的无条件同义词。(randomservices.org)

统计估计

对于来自 (U(a,b)) 且具有统计独立性的观测值,若两个端点均未知,且至少有两个不同的观测值,则最大似然估计给出

[ \hat a=\min_i X_i,\qquad \hat b=\max_i X_i. ]

当区间包含所有观测值时,似然函数与 ((b-a)^{-n}) 成正比;否则为零。包含全部样本的最窄区间使似然函数达到最大值。(itl.nist.gov)

这些端点估计存在向区间内部偏移的偏差。对于容量为 (n) 的样本,有

[ E[\hat a]=a+\frac{b-a}{n+1}, \qquad E[\hat b]=b-\frac{b-a}{n+1}. ]

这些公式可由标准均匀样本最小值和最大值的期望经尺度变换得出。随着样本量增加,每个估计值与其对应端点之间的期望距离都会减小。(itl.nist.gov)