二项分布是一种离散概率分布,描述固定次数的独立试验中成功的次数;每次试验都有两种可能的结果,且成功的概率相同。它是统计学中用于二元观测和计数的基本模型。服从这一分布的随机变量通常记作 ,其中 为试验次数, 为成功概率。“成功”只是对所计数结果的称呼,并不一定表示结果是理想的。(csrc.nist.gov)
定义与假设
二项试验有四个基本条件:
- 试验次数 固定。
- 每次试验的结果分为成功或失败。
- 各次试验满足统计独立性。
- 各次试验的成功概率 相同。
这些条件针对的是概率模型,而不只是观测结果的表面形式。如果各次结果相互影响,或其概率发生变化,那么一串二元结果并不必然服从二项分布。(online.stat.psu.edu)
每次试验都可以用指示变量 表示,成功时取 1,失败时取 0。每个 都服从参数为 的伯努利分布,且
因此,二项随机变量是相互独立、同分布的伯努利随机变量之和。其可能取值为整数 。当 时,二项分布就化为伯努利分布。(online.stat.psu.edu)
概率公式
当 时,概率质量函数为
其中
二项式系数表示从各次试验中选出 次成功试验的方式数。由独立性可知,每一种特定排列的概率都是 ;将其乘以排列的数量,就得到上述公式。二项式定理表明,这些概率之和为 。(online.stat.psu.edu)
例如,假设将一枚均匀硬币独立抛掷十次,并把出现正面称为成功,则
这是恰好出现三次正面的概率,与正面出现的顺序无关。该计算直接将数值代入概率公式即可。(itl.nist.gov)
累积分布函数在整数 处的值为
因此,“至少 次”的概率是 ,而不是 。当 时,全部概率集中在 0 处;当 时,全部概率集中在 处,这可以直接由试验的定义得出。(itl.nist.gov)
均值、变异与分布形状
这些表达式可以由伯努利分布的相应矩,以及独立随机变量的方差可加性推导出来。期望值是重复试验中的平均值,不一定是某次试验实际能够产生的整数计数。(online.stat.psu.edu)
当 为正且 时,分布在 时对称,在 时右偏,在 时左偏。其偏度为
概率最大的计数为 ;但当 为整数时,该整数及其前一个整数都是众数。(itl.nist.gov)
比例与统计推断
当 时,样本比例为 。其均值为 ,标准误为
这将二项计数与比例的抽样变异联系起来:增加独立试验的次数会减小这种变异。(online.stat.psu.edu)
在已知 并观测到 次成功的情况下,似然函数与 成正比。最大似然估计给出 。置信区间用于表达这一点估计之外的不确定性;精确二项置信区间可通过求解涉及二项分布尾部概率的方程获得。在样本量较小或失败次数极少时,基于正态分布的简单对称区间可能不够准确。(itl.nist.gov)
在贝叶斯推断中,贝塔分布可作为 的共轭先验。如果先验分布为 ,那么在 次试验中观测到 次成功后,得到的后验分布为
这一结果可通过将贝塔分布的密度乘以二项似然推导出来。(bookdown.org)
近似与模型适用边界
中心极限定理表明,当 固定时,随着 增大,标准化后的二项计数趋于标准正态分布。正态近似采用均值 和方差 。连续性校正将整数边界调整半个单位;例如,对于相应的正态随机变量 ,用 近似 。(online.stat.psu.edu)
当成功事件较为罕见时,参数为 的泊松分布是另一种近似。从严格的极限意义上说,当 增大、 趋于零,且 趋于一个有限的正常数时,二项分布的概率趋于泊松分布的概率。(online.stat.psu.edu)
从有限总体中进行不放回抽样,通常会产生超几何分布,因为相继抽取的结果并不独立。不过,当样本相对于总体很小时,二项近似仍可能有较好的效果。因此,仅凭二元分类并不能确定二项模型适用;抽样机制和试验假设仍然至关重要。(online.stat.psu.edu)