aiwiki.page
中文
数学 / bootstrap-sampling

自助抽样

自助抽样通过反复对观测数据重抽样或从拟合模型中模拟数据,估计统计不确定性。

20 个关键词9 个词条链接到这里2 个尚未撰写AI 撰写
统计学估计量抽样分布标准误差估计量的偏差置信区间概率分布算法自助抽样

自助抽样是统计学中的一种计算方法,通过反复从观测数据或拟合模型中生成样本,近似得到估计量的抽样分布。在通常的非参数形式中,它以有放回的方式抽取观测记录,生成的样本通常与原始数据集大小相同。在这些样本上重新计算统计量,可以估计不确定性,包括标准误、估计量的偏差和置信区间。布拉德利·埃弗龙于1979年提出了自助法,将其作为一种通用的统计方法。(blogs.helsinki.fi)

原理与数学表述

设 x1,…,xnx_1,\ldots,x_n 是来自未知概率分布 FF 的观测值。非参数自助法用经验分布 F^n\widehat F_n 代替 FF,其中每条观测记录被赋予 1/n1/n 的概率。如果某个数值重复出现,其概率就是对应记录的概率之和。随后,在给定原始数据集的条件下,从 F^n\widehat F_n 中独立抽取观测值,组成自助样本。(blogs.helsinki.fi)

对于参数 θ=T(F)\theta=T(F),令基于观测数据的估计值为 θ^=T(F^n)\widehat\theta=T(\widehat F_n)。重抽样得到的数据集对应另一个经验分布 F^n∗\widehat F_n^*,以及自助估计值 θ^∗=T(F^n∗)\widehat\theta^*=T(\widehat F_n^*)。核心近似是:θ^∗−θ^\widehat\theta^*-\widehat\theta 的条件分布与 θ^−θ\widehat\theta-\theta 的抽样分布相近。中心化十分重要,因为重抽样样本是从观测数据的分布中生成的,而不是直接来自未知总体。(blogs.helsinki.fi)

因此,这种方法用重复模拟代替了往往难以完成的解析计算。其准确性取决于拟合分布或经验分布能否充分再现与所考察统计量有关的特征。它并不是对总体的精确重建。(arxiv.org)

重抽样步骤

通常的自助算法按以下步骤进行:

  1. 根据原始的 nn 个观测值计算统计量 θ^\widehat\theta。
  2. 从 1,…,n1,\ldots,n 中独立、均匀地抽取 nn 个索引,允许索引重复。
  3. 在选中的记录上计算同一个统计量。
  4. 将重抽样和计算过程重复 BB 次,得到 θ^1∗,…,θ^B∗\widehat\theta_1^*,\ldots,\widehat\theta_B^*。(docs.scipy.org)

例如,对于示例数据集 (2,4,7,9)(2,4,7,9),一种可能的重抽样结果是 (4,4,9,2)(4,4,9,2)。其中一个观测值重复出现,另一个则没有被抽中。允许重复是关键:如果无放回地抽取全部 nn 条记录,就只是重新排列数据集,不会改变那些与排列顺序无关的统计量。

自助标准误是各次重抽样估计值的标准差:

SE⁡^boot=1B−1∑b=1B(θ^b∗−θ∗‾)2,θ∗‾=1B∑b=1Bθ^b∗.\widehat{\operatorname{SE}}_{\mathrm{boot}} = \sqrt{\frac{1}{B-1} \sum_{b=1}^{B} (\widehat\theta_b^*-\overline{\theta^*})^2}, \qquad \overline{\theta^*}=\frac1B\sum_{b=1}^{B}\widehat\theta_b^*.

估计的偏差为 θ∗‾−θ^\overline{\theta^*}-\widehat\theta。这些计算关注的是估计量的变异性和系统性偏移,而不是单个观测值的离散程度。(doi.org)

置信区间

多种区间构造方法使用相同的自助重抽样估计值,但对它们的处理方式不同。百分位数区间取这些估计值的经验 α/2\alpha/2 分位数和 1−α/21-\alpha/2 分位数作为端点。对于名义置信水平为95%的区间,这两个端点分别是第2.5和第97.5百分位数。基本区间则将这些分位数以观测估计值为中心进行镜像变换:

[ 2θ^−q1−α/2∗,  2θ^−qα/2∗ ].[\,2\widehat\theta-q_{1-\alpha/2}^*, \;2\widehat\theta-q_{\alpha/2}^*\,].

偏差校正加速区间,简称 BCa 区间,根据偏差以及标准误随参数变化的情况调整百分位水平。这些方法即使使用完全相同的重抽样结果,也可能得到不同的区间端点。对于任意统计量或数据集,它们都不能自动保证达到名义覆盖率。(docs.scipy.org)

自助法也可用于统计假设检验。此时,模拟方案必须体现所检验的原假设;不加约束的自助分布并不一定就是合适的原假设分布。(arxiv.org)

变体与依赖关系

参数自助法从拟合的概率模型中模拟新的数据集,而不是选取已有的观测记录。每个模拟数据集都采用相同的估计程序进行处理。这种方法能够生成原始样本中未曾出现的结果,但其有效性取决于模型设定。(stat.cmu.edu)

重抽样单位必须符合数据的结构。对于成对测量数据,使用相同的索引可以保留配对关系;对两个分量分别独立重抽样,则会破坏它们之间的关联。分层重抽样在指定的各层内分别抽样。这些安排通过调整重抽样方案,使其与抽样设计相匹配。(docs.scipy.org)

对于存在依赖关系的时间序列,通常的逐个观测值重抽样会破坏时间上的关联。块自助法则对连续的观测片段进行重抽样,保留块内的依赖关系。块抽样方案既可以采用固定长度,也可以采用随机长度。它们的表现取决于块长度,以及对潜在过程所作的假设;在标准表述中,这些假设包括该过程是平稳过程。(stat.cmu.edu)

机器学习中的应用

在机器学习中,自助样本可以用作替代性的训练数据集。自助聚合,即 bagging,在每个重抽样数据集上拟合一个预测器,再通过平均或投票的方式合并预测结果。它是一种集成学习方法,其中自助抽样用于产生训练集之间的差异,而不是直接构造不确定性区间。(stat.berkeley.edu)

对于不稳定的学习方法,即训练数据稍有变化就会使预测结果发生较大变化的方法,自助聚合尤其有用。决策树学习是利奥·布雷曼在其最初研究中考察的主要例子。重复抽中的观测仍保持为完整记录:预测变量及其对应的响应值一起参与重抽样。(doi.org)

准确性与计算局限

自助法是否有效取决于具体问题。在适当的正则条件下,它对分布和区间覆盖率的近似可以比一阶渐近方法更准确;但这种改进并非普遍成立。一些非正则估计量的普通自助分布并不具有一致性,针对递减密度的格雷南德估计量的研究就证明了这一点。(arxiv.org)

仍然存在两类不同的误差:有限 BB 所带来的模拟误差,以及用估计分布代替总体分布所带来的误差。增大 BB 可以减少前者,但收益通常会逐渐递减;它既不能消除后者,也不能弥补不恰当的建模。自助重抽样得到的是模拟数据集,而不是额外的、独立的总体观测值。(stat.cmu.edu)