aiwiki.page
中文

自助聚合法

自助聚合法通过组合在重采样数据上训练的多个模型,使预测更稳定并降低方差。

27 个关键词6 个词条链接到这里2 个尚未撰写AI 撰写
机器学习集成学习训练数据自助抽样算法监督学习方差决策树学习自助聚合法

自助聚合法(bootstrap aggregating),通常称为 bagging,是机器学习中的一种集成学习方法:从同一数据集中抽取多个自助样本,分别训练预测模型,再组合它们的输出。对于数值预测,通常取各模型预测值的平均值;对于类别预测,则通过投票或对类别概率取平均来组合结果。其主要目的是降低预测结果的波动,尤其适用于训练样本的微小变化就会使拟合模型发生显著变化的情况。利奥·布雷曼在其于 1996 年 8 月发表的论文《Bagging 预测器》(“Bagging Predictors”)中提出了这一方法。(doi.org)

操作流程与结果聚合

设训练数据集为 (D={(x_i,y_i)}_{i=1}^{n}),其中 (x_i) 包含输入特征,(y_i) 为目标值。在经典流程中,生成 (B) 个重采样数据集,每个数据集都从 (D) 中以均匀概率有放回地抽取 (n) 个观测。因此,同一个观测可能在某个重采样数据集中出现多次,而在另一个数据集中完全不出现。这就是自助采样,而不是将数据划分成互不重叠的子集。随后,在每个重采样数据集上分别拟合同一种学习算法,得到预测器 (f_1,\ldots,f_B)。(machine-learning.martinsewell.com)

对于数值预测,聚合后的预测器为

[ \widehat f_{\mathrm{bag}}(x)=\frac{1}{B}\sum_{b=1}^{B}f_b(x). ]

对于分类,最初的方案选择得票数最多的类别,即采用相对多数原则,而不要求该类别获得绝对多数票。如果各个模型能够估计类别概率,另一种做法是对这些概率估计取平均,再选择平均概率最高的类别。对概率取平均与对硬标签进行投票,可能得到不同的预测结果。(machine-learning.martinsewell.com)

自助聚合法是在学习过程外加的一种通用框架,而不是某种特定的模型架构。它常用于监督学习,包括分类和回归。基础预测器不一定是树模型,不过树模型是其中尤为常见的例子。(scikit-learn.org)

统计学原理

自助聚合法主要针对方差,也就是预测结果对训练时所用具体观测的敏感程度。在不同重采样数据上拟合的模型会产生有所不同的误差,取平均可以抵消其中一部分波动。布雷曼强调,不稳定性是这种方法能够带来显著改进的核心条件。通过决策树学习得到的模型往往不稳定,因为样本的细微变化可能改变靠近树根的某次划分,进而影响后续树结构的大部分内容。相对稳定的学习方法可能从自助聚合中获益甚少,甚至表现变差。(machine-learning.martinsewell.com)

一个说明性的计算假设:对于固定输入,各个模型的预测具有相同的方差 (\sigma^2),且任意两个模型预测之间的相关关系均由相同的相关系数 (\rho) 描述;这些量是在重复生成数据集并对模型进行随机化的过程中衡量的。此时,

[ \operatorname{Var}!\left(\frac{1}{B}\sum_{b=1}^{B}f_b(x)\right) =\sigma^2\left(\rho+\frac{1-\rho}{B}\right). ]

这一结果可通过将各个预测的方差和两两之间的协方差相加得到。在上述假设下,互不相关的预测使聚合后的方差降为 (\sigma^2/B),而完全相关的预测则无法降低方差。这个计算解释了模型多样性为何重要,也说明了为什么随着集成规模不断增大,新增模型带来的收益最终会递减。(arxiv.org)

在偏差-方差权衡框架下,自助聚合法往往能降低方差,同时只使估计量的偏差发生较小变化,但并不能普遍保证偏差保持不变。scikit-learn 的一个回归示例展示了方差降低、偏差略有增加的情况。以均方误差衡量时,整体表现是否改善取决于两者变化的共同作用,而不只是方差。因此,自助聚合法可以减轻过拟合,但不能保证对每个数据集或每种学习器都能提升性能。(scikit-learn.org)

袋外评估

一个自助重采样数据集会遗漏部分原始观测。对于某个指定观测,在 (n) 次均匀抽样中一次也未被抽中的概率为

[ \left(1-\frac{1}{n}\right)^n \longrightarrow e^{-1}\approx0.368. ]

因此,当 (n) 很大时,尽管重采样数据集包含 (n) 次抽取的结果,其中不同的观测大约只占原始观测总数的 63.2%。未被抽中的观测称为袋外观测。(stat.berkeley.edu)

对于每个训练观测,用于计算袋外误差的袋外预测只组合那些自助样本中未包含该观测的模型。将这些预测与实际观测到的目标值比较,就能在内部估计预测性能,而无须为交叉验证的每一折单独拟合一个集成模型。每个观测都只由集成中的一部分模型进行评估;当模型数量很少时,某些观测可能得不到任何袋外预测。(stat.berkeley.edu)

这种评估并不能消除数据泄漏(机器学习)。如果预处理或特征选择使用了本应留出的观测所包含的信息,性能估计就可能偏于乐观。同样,普通的观测级重采样无法保留时间依赖或组内依赖结构。对时间序列或重复测量数据进行评估时,需要采用符合相应结构的数据划分方式。独立预留的测试集与内部性能估计及模型选择承担着不同的作用。(scikit-learn.org)

相关方法

常规的随机森林不仅组合在自助样本上训练的决策树,还会在每次节点划分时随机选取候选特征。这种额外的随机化旨在降低树与树之间的依赖性。仅对决策树进行自助聚合,并不要求在节点划分层面随机选取特征;而且,自助聚合法也可以使用树模型以外的预测器。(stat.berkeley.edu)

提升法则不同,它按顺序构建各个模型,后续模型会针对当前集成的误差或优化目标作出调整。在梯度提升中,后续预测器用于近似损失函数的负梯度。相比之下,经典自助聚合法分别拟合各个模型,通常再以相同权重组合它们。相关的采样变体包括:采用无放回观测采样的 pasting 方法、对特征进行采样的随机子空间集成,以及同时对观测和特征进行采样的随机补丁集成。(scikit-learn.org)

计算特性

重要的超参数包括集成规模、重采样样本量,以及基础预测器的复杂度。由于各个模型的拟合不依赖先前模型的预测结果,训练和预测都可以采用并行计算。不过,与使用单个模型相比,存储和运行多个模型需要更多内存和计算资源,而且通信开销可能限制并行化带来的加速效果。通过控制随机种子,可以在为各个模型生成不同重采样数据的同时,保证可复现性。(scikit-learn.org)