充分统计量是观测数据的函数,在指定的统计学模型下,它保留了这些数据所提供的关于未知参数的全部信息。形式上,一旦知道其取值,原始数据的条件分布就不再依赖该参数。因此,充分性允许在不损失参数相关信息的前提下缩减数据,但不一定保留其他用途所需的信息。罗纳德·费希尔于 1922 年提出了这一概念。(stat.umn.edu)
定义与解释
设 (X=(X_1,\ldots,X_n)) 为一个样本,其联合概率分布属于分布族 ({P_\theta:\theta\in\Theta})。统计量 (T(X)) 是观测值的函数,其中不含未知参数。如果给定 (T(X)) 时 (X) 的条件分布可以选取为对所有 (\theta) 都相同的分布,则称 (T(X)) 对 (\theta) 是充分的。对于连续型观测,这一定义使用条件分布,而不是用零概率事件的概率作简单比值。(stat.cmu.edu)
充分性的含义取决于所采用的模型:它针对的是整个指定的概率分布族,而不仅是某一组已观测到的数据。完整样本始终是充分的,因此,仅有充分性并不保证能大幅压缩数据。充分统计量既可以是标量,也可以是向量。它本身的分布通常依赖于 (\theta);不依赖参数的是给定该统计量后,数据中剩余变动的分布。(stat.cmu.edu)
因子分解定理
奈曼–费希尔因子分解定理提供了一种实用的判定方法。对于相对于同一个支配测度具有联合密度函数或联合质量函数 (f_\theta(x)) 的分布族,在满足通常的可测性条件时,(T) 是充分统计量,当且仅当
[ f_\theta(x)=g_\theta(T(x))h(x), ]
其中,(h) 不依赖于 (\theta),而 (g_\theta) 对观测值的依赖仅通过 (T(x)) 体现。这一表述既适用于概率密度函数,也适用于概率质量函数。(stat.cmu.edu)
因此,可以从该统计量重建似然函数,至多相差一个与参数无关的乘法因子。充分统计量取值相同的样本,其似然函数成比例。充分统计量经过任何可逆变换后仍然充分;在保留它的同时额外保留一些观测值,也不会破坏充分性,但多对一的变换则可能破坏充分性。(bookdown.org)
示例
假设各观测值相互独立,均服从成功概率为 (p) 的伯努利分布。其联合质量函数为
[ f_p(x)=p^{\sum_i x_i}(1-p)^{n-\sum_i x_i}. ]
因此,成功次数 (T=\sum_iX_i) 是关于 (p) 的充分统计量。给定 (T=t) 后,所有恰好包含 (t) 次成功的二元序列都等可能出现,且这种条件概率与 (p) 无关。该统计量服从参数为 (n,p) 的二项分布;在这一模型下,成功出现的次序不提供关于 (p) 的额外信息。(stat.cmu.edu)
对于来自均值为 (\mu)、方差 (\sigma^2) 已知的正态分布的独立观测值,样本均值 (\bar X) 是关于 (\mu) 的充分统计量。当两个参数都未知时,一个充分统计量为
[ T(X)=\left(\sum_iX_i,\ \sum_iX_i^2\right). ]
当 (n\geq2) 时,这等价于保留样本均值和样本方差。对于不受限制的参数对 ((\mu,\sigma^2)),仅有样本均值并不充分。(stat.cmu.edu)
来自均值同为 (\lambda) 的泊松分布的独立观测值,同样以 (\sum_iX_i) 为充分统计量。给定这一总和后,各观测值之间计数的分配方式不依赖于 (\lambda)。(stat.cmu.edu)
最小充分性
最小充分统计量本身是充分的,并且在适当的几乎必然意义下,可以表示为任何其他充分统计量的函数。它体现了在保持充分性的同时,对样本所能作出的最大程度的缩减。“最小”指的是所保留的信息,而不只是表示时所用坐标的数量。不同的数值表示可能描述相同的最小充分信息。(stat.cmu.edu)
对于常见的、具有正密度的受支配模型,一个实用的判别准则是
[ T(x)=T(y) \quad\Longleftrightarrow\quad \frac{f_\theta(x)}{f_\theta(y)} \text{ 与 }\theta\text{ 无关。} ]
这一准则将似然函数成比例的样本归为一组。当密度可能为零时,还必须考虑支撑集的条件,而不能直接除以零。泊松样本的总和是最小充分统计量。相比之下,在尺度参数已知的柯西位置模型中,将样本值按大小排序所得的样本是最小充分统计量:可以舍去观测值的原始次序,但一般不能将数据缩减为几个常用的概括性统计量。(stat.cmu.edu)
指数族
充分统计量在指数族中自然出现。若单个观测值的密度为
[ f_\theta(x)=h(x) \exp!\left{\sum_{j=1}^{k}\eta_j(\theta)t_j(x)-A(\theta)\right}, ]
且支撑集不依赖于参数,那么独立同分布样本的一个充分统计量为
[ \left(\sum_i t_1(X_i),\ldots,\sum_i t_k(X_i)\right). ]
其分量个数不会随样本量增加。因子分解定理可直接证明这一结果。伯努利、泊松和正态模型说明,为了对模型参数进行推断,规模不断增长的数据集可以用长度固定的汇总量表示。这种表示具有充分性,但最小充分性还需要额外条件。(live.ocw.mit.edu)
估计与贝叶斯推断
拉奥–布莱克韦尔定理将充分性与估计联系起来。如果 (U(X)) 是具有有限二阶矩的无偏估计量,且 (T) 是充分统计量,那么
[ U^*(T)=\mathbb E[U(X)\mid T] ]
也是无偏的,且其方差不大于 (U) 的方差。充分性保证这一条件期望可以在不知道 (\theta) 的情况下定义。如果 (T) 还具有完备性,那么莱曼–谢费定理表明:若存在 (T) 的无偏函数,它就是唯一的一致最小方差无偏估计量。完备性与充分性是不同的性质。(bookdown.org)
在贝叶斯推断中,若先验分布固定且后验分布有良好定义,因子分解便意味着后验分布对观测值的依赖仅通过充分统计量体现。同样,最大似然估计也可以使用缩减后的似然函数。这些结论针对的是所假定模型内的推断:被舍弃的数据,对于检验模型假设或研究该模型之外的问题,仍可能很重要。(stat.umn.edu)