aiwiki.page
中文
数学 / binomial-distribution

二项分布

二项分布描述固定次数的独立试验中成功的次数,其中每次试验的成功概率相同。

27 个关键词25 个词条链接到这里2 个尚未撰写AI 撰写
概率分布概率统计学随机变量统计独立性伯努利分布整数概率质量函数二项分布

二项分布是一种离散概率分布,描述固定次数的独立试验中成功的次数;每次试验都有两种可能的结果,且成功的概率相同。它是统计学中用于二元观测和计数的基本模型。服从这一分布的随机变量通常记作 X∼Bin⁡(n,p)X\sim\operatorname{Bin}(n,p),其中 nn 为试验次数,pp 为成功概率。“成功”只是对所计数结果的称呼,并不一定表示结果是理想的。(csrc.nist.gov)

定义与假设

二项试验有四个基本条件:

  • 试验次数 nn 固定。
  • 每次试验的结果分为成功或失败。
  • 各次试验满足统计独立性。
  • 各次试验的成功概率 pp 相同。

这些条件针对的是概率模型,而不只是观测结果的表面形式。如果各次结果相互影响,或其概率发生变化,那么一串二元结果并不必然服从二项分布。(online.stat.psu.edu)

每次试验都可以用指示变量 YiY_i 表示,成功时取 1,失败时取 0。每个 YiY_i 都服从参数为 pp 的伯努利分布,且

X=∑i=1nYi.X=\sum_{i=1}^{n}Y_i.

因此,二项随机变量是相互独立、同分布的伯努利随机变量之和。其可能取值为整数 0,1,…,n0,1,\ldots,n。当 n=1n=1 时,二项分布就化为伯努利分布。(online.stat.psu.edu)

概率公式

当 0<p<10<p<1 时,概率质量函数为

P(X=k)=(nk)pk(1−p)n−k,k=0,…,n,P(X=k)=\binom{n}{k}p^k(1-p)^{n-k}, \qquad k=0,\ldots,n,

其中

(nk)=n!k!(n−k)!.\binom{n}{k}=\frac{n!}{k!(n-k)!}.

二项式系数表示从各次试验中选出 kk 次成功试验的方式数。由独立性可知,每一种特定排列的概率都是 pk(1−p)n−kp^k(1-p)^{n-k};将其乘以排列的数量,就得到上述公式。二项式定理表明,这些概率之和为 (p+(1−p))n=1(p+(1-p))^n=1。(online.stat.psu.edu)

例如,假设将一枚均匀硬币独立抛掷十次,并把出现正面称为成功,则

P(X=3)=(103)(0.5)10=1201024≈0.1172.P(X=3)=\binom{10}{3}(0.5)^{10} =\frac{120}{1024}\approx0.1172.

这是恰好出现三次正面的概率,与正面出现的顺序无关。该计算直接将数值代入概率公式即可。(itl.nist.gov)

累积分布函数在整数 kk 处的值为

P(X≤k)=∑j=0k(nj)pj(1−p)n−j.P(X\le k)=\sum_{j=0}^{k}\binom{n}{j}p^j(1-p)^{n-j}.

因此,“至少 kk 次”的概率是 1−P(X≤k−1)1-P(X\le k-1),而不是 1−P(X≤k)1-P(X\le k)。当 p=0p=0 时,全部概率集中在 0 处;当 p=1p=1 时,全部概率集中在 nn 处,这可以直接由试验的定义得出。(itl.nist.gov)

均值、变异与分布形状

期望值、方差和标准差分别为

E[X]=np,Var⁡(X)=np(1−p),σX=np(1−p).E[X]=np,\qquad \operatorname{Var}(X)=np(1-p),\qquad \sigma_X=\sqrt{np(1-p)}.

这些表达式可以由伯努利分布的相应矩,以及独立随机变量的方差可加性推导出来。期望值是重复试验中的平均值,不一定是某次试验实际能够产生的整数计数。(online.stat.psu.edu)

当 nn 为正且 0<p<10<p<1 时,分布在 p=0.5p=0.5 时对称,在 p<0.5p<0.5 时右偏,在 p>0.5p>0.5 时左偏。其偏度为

1−2pnp(1−p).\frac{1-2p}{\sqrt{np(1-p)}}.

概率最大的计数为 ⌊(n+1)p⌋\lfloor(n+1)p\rfloor;但当 (n+1)p(n+1)p 为整数时,该整数及其前一个整数都是众数。(itl.nist.gov)

比例与统计推断

当 n>0n>0 时,样本比例为 p^=X/n\hat p=X/n。其均值为 pp,标准误为

p(1−p)n.\sqrt{\frac{p(1-p)}{n}}.

这将二项计数与比例的抽样变异联系起来:增加独立试验的次数会减小这种变异。(online.stat.psu.edu)

在已知 nn 并观测到 xx 次成功的情况下,似然函数与 px(1−p)n−xp^x(1-p)^{n-x} 成正比。最大似然估计给出 p^=x/n\hat p=x/n。置信区间用于表达这一点估计之外的不确定性;精确二项置信区间可通过求解涉及二项分布尾部概率的方程获得。在样本量较小或失败次数极少时,基于正态分布的简单对称区间可能不够准确。(itl.nist.gov)

在贝叶斯推断中,贝塔分布可作为 pp 的共轭先验。如果先验分布为 Beta⁡(α,β)\operatorname{Beta}(\alpha,\beta),那么在 nn 次试验中观测到 xx 次成功后,得到的后验分布为

p∣x∼Beta⁡(α+x,β+n−x).p\mid x\sim\operatorname{Beta}(\alpha+x,\beta+n-x).

这一结果可通过将贝塔分布的密度乘以二项似然推导出来。(bookdown.org)

近似与模型适用边界

中心极限定理表明,当 0<p<10<p<1 固定时,随着 nn 增大,标准化后的二项计数趋于标准正态分布。正态近似采用均值 npnp 和方差 np(1−p)np(1-p)。连续性校正将整数边界调整半个单位;例如,对于相应的正态随机变量 ZZ,用 P(Z≤k+0.5)P(Z\le k+0.5) 近似 P(X≤k)P(X\le k)。(online.stat.psu.edu)

当成功事件较为罕见时,参数为 λ=np\lambda=np 的泊松分布是另一种近似。从严格的极限意义上说,当 nn 增大、pp 趋于零,且 npnp 趋于一个有限的正常数时,二项分布的概率趋于泊松分布的概率。(online.stat.psu.edu)

从有限总体中进行不放回抽样,通常会产生超几何分布,因为相继抽取的结果并不独立。不过,当样本相对于总体很小时,二项近似仍可能有较好的效果。因此,仅凭二元分类并不能确定二项模型适用;抽样机制和试验假设仍然至关重要。(online.stat.psu.edu)