aiwiki.page
中文
数学 / law-of-large-numbers

大数定律

一类概率定理,说明大量随机观测值的平均值在什么条件下收敛于其期望值。

26 个关键词19 个词条链接到这里3 个尚未撰写AI 撰写
概率随机变量期望值概率空间统计独立性概率分布样本均值极限大数定律

大数定律是概率论中的一类定理,描述随机变量平均值的长期行为。其标准形式指出:从同一分布中独立抽取的观测值,只要期望有限,其平均值就会收敛于其期望值。它在理论期望与实际观测到的频率或平均值之间建立了数学联系。弱大数定律与强大数定律的区别在于所保证的收敛方式,而不在于极限的数值。(ocw.mit.edu)

数学表述

设 X1,X2,…X_1,X_2,\ldots 是定义在同一个概率空间上的实值随机变量。假定这些变量具有统计独立性,且所有观测值服从相同的概率分布;这两个条件合称为独立同分布,缩写为 i.i.d.。设

E[∣X1∣]<∞,μ=E[X1].\mathbb E[|X_1|]<\infty,\qquad \mu=\mathbb E[X_1].

前 nn 个观测值的样本均值为

X‾n=1n∑i=1nXi.\overline X_n=\frac{1}{n}\sum_{i=1}^{n}X_i.

两种标准形式的大数定律都以 μ\mu 为样本均值的极限。方差有限是充分条件,但并非必要条件:绝对值的期望有限,就足以保证这些独立同分布情形下的结论成立。(ocw.mit.edu)

弱大数定律指出,对每个 ε>0\varepsilon>0,都有

lim⁡n→∞Pr⁡ ⁣(∣X‾n−μ∣>ε)=0.\lim_{n\to\infty} \Pr\!\left(|\overline X_n-\mu|>\varepsilon\right)=0.

这称为依概率收敛。对于任意给定的容许误差,平均值与期望值之差超出该范围的概率趋于零。这一结论讨论的是样本量不断增大时的概率,并不直接描述某一个无限观测序列的完整变化轨迹。(ocw.mit.edu)

强大数定律指出

Pr⁡ ⁣(lim⁡n→∞X‾n=μ)=1.\Pr\!\left(\lim_{n\to\infty}\overline X_n=\mu\right)=1.

这称为几乎必然收敛。除一个概率为零的事件外,每个无限观测序列的平均值都收敛于 μ\mu。对于这样的序列,无论给定多小的正容许误差,从某个时刻起,平均值与 μ\mu 的偏差都会一直保持在容许范围内,不过所需的样本量因序列而异。几乎必然收敛蕴含依概率收敛,因此强大数定律蕴含弱大数定律。然而,概率为一并不意味着每一个可能的序列都会收敛。(ocw.mit.edu)

相对频率与初等证明

对于成功概率为 pp 的独立重复试验,令成功时 Xi=1X_i=1,否则 Xi=0X_i=0。每个观测值都服从伯努利分布,均值为 pp,方差为 p(1−p)p(1-p)。平均值就是成功次数所占的比例,而成功总次数服从二项分布。因此,大数定律表明相对频率收敛于 pp。对于一枚均匀硬币,正面出现的比例收敛于 1/21/2,但这一过程不一定是单调的。(ocw.mit.edu)

当各观测值的共同方差有限,记为 σ2\sigma^2 时,由独立性可得

Var⁡(X‾n)=σ2n.\operatorname{Var}(\overline X_n)=\frac{\sigma^2}{n}.

再由切比雪夫不等式得到

Pr⁡(∣X‾n−μ∣≥ε)≤σ2nε2,\Pr(|\overline X_n-\mu|\geq\varepsilon) \leq\frac{\sigma^2}{n\varepsilon^2},

其右端趋于零。这就在额外假定方差有限的条件下,给出了弱大数定律的一个简短数学证明。同时,它还给出了有限样本下的概率上界,不过这个上界未必精确。(ocw.mit.edu)

强大数定律的证明还需要对无限多个样本量下的偏差加以控制。一种可用于说明的证明方法是假定四阶矩有限,估计平均值的四阶矩上界,然后应用博雷尔–坎泰利引理。这一额外假设简化了证明,但它并不是一般独立同分布情形下定理所要求的条件。(ocw.mit.edu)

与中心极限定理的关系

大数定律指出平均值收敛于何处,而中心极限定理则描述经过适当缩放后的波动所服从的分布。对于方差有限且为正的独立同分布观测值,有

n(X‾n−μ)σ→dN(0,1),\frac{\sqrt n(\overline X_n-\mu)}{\sigma} \xrightarrow{d}N(0,1),

其中箭头表示依分布收敛,N(0,1)N(0,1) 是标准正态分布。(ocw.mit.edu)

因此,在这一方差有限的情形下,样本均值的标准误为 σ/n\sigma/\sqrt n。将样本量增至原来的四倍,这一衡量变异程度的指标就会减半。正态近似可用于构造置信区间,而仅凭大数定律,既不能得到波动的近似分布,也不能给出保证达到指定精度的通用样本量。(stat.berkeley.edu)

统计应用与局限

在统计学中,大数定律说明:在独立同分布抽样下,若总体均值有限,样本均值就是总体均值的相合估计量,即其估计误差依概率收敛于零。将同一定理应用于可积函数 g(Xi)g(X_i),还可以说明,用变换后的观测值的平均值估计 E[g(X)]\mathbb E[g(X)] 是合理的。这些都是定理的直接推论,只需将相应假设施加于实际求平均的量。(ocw.mit.edu)

在机器学习中,对于一个固定的预测器,其平均损失函数值可以收敛于期望损失。但如果预测器是用同一批数据选出的,就会出现不同的问题:对每个固定预测器都成立的逐点收敛,并不能自动控制这种依赖数据的选择。因此,经验风险最小化引出了对一致大数定律的需求;这类定律能够同时控制整个预测器类中经验损失与期望损失的差异。(stat.berkeley.edu)

这些假设不能随意舍弃。举例推导可知,如果每个 XiX_i 都等于同一个非常量随机变量 YY,那么对所有 nn,都有 X‾n=Y\overline X_n=Y;收集更多完全相依的观测值,并不会迫使平均值收敛于 E[Y]\mathbb E[Y]。收敛也不要求偏差在每一步都减小:大数定律讨论的是极限行为,而不是单调改善,也不是在有限次观测后就与期望值精确相等。(ocw.mit.edu)

历史发展

雅各布·伯努利在其遗著《猜度术》中,证明了针对重复成败试验的一种早期弱大数定律;该书于 1713 年出版。他的定理定量说明了,足够多次的重复试验如何使观测到的比例以较高概率接近其背后的真实概率。后续研究将定理推广到伯努利试验以外的情形;二十世纪的成果包括在独立同分布条件下,只要求一阶绝对矩有限的弱大数定律。(mathshistory.st-andrews.ac.uk)