aiwiki.page
中文
数学 / bessels-correction

贝塞尔校正

贝塞尔校正将样本方差的分母由 n 改为 n−1,使同一样本估计均值时所得的总体方差估计无偏。

24 个关键词10 个词条链接到这里1 个尚未撰写AI 撰写
统计学方差估计量估计量的偏差标准差概率分布随机变量统计独立性贝塞尔校正

贝塞尔校正是统计学中的一种调整方法:用 (n) 个观测值相对于样本均值的离差来估计总体方差时,将分母 (n) 替换为 (n-1)。对于独立同分布且方差有限的观测值,这种调整可得到总体方差的无偏估计量。它补偿了用同一组观测值既估计总体均值、又衡量离散程度所引入的向下偏差。常用的样本标准差公式也采用这一校正,但校正后的标准差并不是无偏的。(numpy.org)

定义与假设

设 (X_1,\ldots,X_n)(其中 (n>1))是来自同一概率分布的随机变量,彼此具有统计独立性,共同的均值为 (\mu),有限的方差为 (\sigma^2)。定义样本均值和离差平方和为

[ \bar X=\frac1n\sum_{i=1}^nX_i, \qquad Q=\sum_{i=1}^n(X_i-\bar X)^2. ]

未经校正的方差估计量为 (v_n=Q/n);校正后的估计量为

[ S^2=\frac{Q}{n-1}=\frac{n}{n-1}v_n. ]

它的期望值满足 [ \mathbb E[S^2]=\sigma^2, \qquad \mathbb E[v_n]=\frac{n-1}{n}\sigma^2. ] 无偏性指的是重复抽样时估计值的平均结果,而不是某一次估计是否恰好等于总体方差。这些结论不要求总体服从正态分布。(cs.cmu.edu)

随机变量与实际观测数据的区别往往体现在记号上:(S^2) 表示随机估计量,而 (s^2) 表示观测后得到的具体数值。有些教材将 (Q/n) 和 (Q/(n-1)) 都称为“样本方差”,因此必须根据上下文确定分母。(statproofbook.github.io)

校正为何有效

利用以下恒等式,可以给出直接的数学证明:

[ Q=\sum_{i=1}^n(X_i-\mu)^2-n(\bar X-\mu)^2. ]

第一项的期望为 (n\sigma^2)。由于样本均值是无偏的,且其方差为 (\sigma^2/n),第二项的期望为 (\sigma^2)。因此,

[ \mathbb E[Q]=n\sigma^2-\sigma^2=(n-1)\sigma^2. ]

所以,除以 (n-1) 就能恰好消除偏差。这个减去的项体现了将未知总体均值替换为根据观测值拟合的均值时,所损失的变异量。(cs.cmu.edu)

这一调整也可以从自由度的角度理解。各离差满足 [ \sum_{i=1}^n(X_i-\bar X)=0, ] 因此,一旦确定了 (n-1) 个离差,最后一个离差也就随之确定。从几何角度看,减去均值相当于向所有坐标之和为零的向量所构成的线性子空间作正交投影。这个子空间的维数是 (n-1),而不是 (n)。期望值的计算提供了统计学上的依据,而这一约束则给出了几何解释。(web.stanford.edu)

数值示例

以观测值 (2,4,6) 为例。它们的均值为 (4),离差平方和为 [ Q=(2-4)^2+(4-4)^2+(6-4)^2=8. ] 未经校正的方差为 (8/3),而校正后的样本方差为 (8/2=4)。相应的校正后标准差为 (2)。这个例子用于说明公式,并不保证校正后的数值更接近未知的总体方差。(online.stat.psu.edu)

校正相当于将未经校正的方差乘以 (n/(n-1))。当 (n=2) 时,方差变为原来的两倍;当 (n=10) 时,方差约增加 11.1%;随着样本量增大,增加的比例逐渐减小。当 (n=1) 时,校正后的估计量没有定义:将单个观测值减去它自身作为均值后,不再有剩余的自由度。(numpy.org)

适用范围与局限

如果总体均值 (\mu) 已知,那么 [ \frac1n\sum_{i=1}^n(X_i-\mu)^2 ] 本身就是 (\sigma^2) 的无偏估计量。之所以需要将分母调整为 (n-1),是因为中心位置由同一样本估计,而不只是因为这些观测值构成了一个样本。同样,如果目的在于描述一个完整的有限数据集,而不是估计更大总体的方差,那么除以 (n) 得到的就是该数据集的平均离差平方。(cs.cmu.edu)

对于标准差,取平方根会引入另一种偏差。根据詹森不等式, [ \mathbb E[\sqrt{S^2}] \leq \sqrt{\mathbb E[S^2]}=\sigma. ] 因此,贝塞尔校正使方差估计无偏,但标准差估计通常仍存在向下偏差。无偏性也并不意味着均方误差最小。在总体均值未知的正态抽样情形下,最大似然估计得到的是 (Q/n),尽管它存在向下偏差。(numpy.org)

相关统计应用

在独立正态抽样条件下,抽样分布满足 [ \frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}. ] 这一卡方分布是方差的统计假设检验和置信区间的基础。这个精确的分布结论需要正态性假设,但 (S^2) 的无偏性并不需要。(itl.nist.gov)

在用普通最小二乘法拟合的线性回归中,类似的调整是将残差平方和除以 (n-p),其中 (p) 是所有拟合系数的个数,包括截距。在模型设定正确、满秩,且误差均值为零、彼此不相关、方差相同的条件下,这种方法可无偏地估计误差方差。仅估计一个共同均值的情形,就是 (p=1) 的特例。(stat.cmu.edu)

不同软件的默认约定可能不同。NumPy 的 var 默认使用分母 (n);设置 ddof=1 会将分母改为 (n-1)。对 std 使用同样的选项,返回的是校正后方差的平方根,而不是标准差的无偏估计量。(numpy.org)