偏差—方差权衡是统计学和机器学习中的一个概念,用于描述系统性预测误差与不同训练样本所导致的预测变动之间的关系。一种学习方法可能产生稳定的预测,却始终偏离真实关系;也可能在平均意义上预测得更准确,但预测结果会随数据变化而大幅变动。目标是实现良好的泛化(机器学习):尽量降低对未见观测的预期误差,而不是单独最小化其中某一项。在平方误差损失下,预测误差可以精确分解为偏差平方、方差和不可约噪声。人们熟悉的“模型越复杂,偏差越小、方差越大”是一种有用的规律,但并非普遍成立的定律。(cs.cmu.edu)
偏差与方差
在监督学习中,算法根据训练数据构建预测器。设想从同一总体中独立抽取许多大小相同的数据集,并反复进行这一过程。对于任一固定输入,拟合得到的预测值都是一个随机变量,因为它取决于抽样得到的数据集。(cs.cmu.edu)
**偏差是预测器在这些数据集上的平均输出与目标值之差。方差**衡量预测值围绕该平均值波动的程度。偏差大表明存在系统性的不准确;方差大表明预测器对具体的训练样本较为敏感。预测器即使偏差很小,也未必在任何一个具体数据集上都可靠。反过来,预测稳定也不意味着预测准确。这些定义针对的是重复抽样,而不只是单个数据集中观测结果的离散程度。(scikit-learn.org)
平方误差分解
令 表示随机训练数据集, 表示基于该数据集拟合得到的预测器。对于输入 处的一个新响应,记
其中,给定输入后的噪声均值为零,方差为 。假设新观测与 相互独立,且所有相关的二阶矩都存在。对训练数据集取期望值,定义平均预测为:
对于平方误差损失函数,预期预测误差为
因此,预期均方误差等于偏差平方、方差与噪声之和。在差值中加上再减去 ,然后展开平方,即可得到这一恒等式:中心化后的交叉项期望为零。再对输入分布取平均,就得到相应的总体预测误差。当预测目标是 本身,而不是一个新的带噪声响应时,分解中不含噪声项。(cs.cmu.edu)
复杂度与拟合
限制较多的模型可能因无法表示重要结构而出现欠拟合。例如,通过线性回归拟合的直线模型无法再现弯曲程度很大的关系。加入更高次的多项式项可以提高灵活性,但也可能使拟合曲线对抽样波动更加敏感。过度敏感可能导致过拟合,即优异的训练表现无法转化为同样出色的预测表现。(scikit-learn.org)
在经典图景中,提高灵活性起初会充分降低偏差平方,从而降低测试误差。超过某个适中的最优点后,方差的增加会抵消并超过偏差进一步减小所带来的收益,形成 U 形误差曲线。最优点取决于数据分布、样本量、噪声和拟合过程,并不是某类模型固有的属性。(doi.org)
调控偏差—方差权衡
正则化通过惩罚项或约束来限制拟合。在岭回归中,对系数大小的平方施加惩罚,会使估计值向零收缩。这会引入偏差,但也能降低方差并改善预测,尤其是在未加惩罚的估计值不稳定时。更强的正则化不一定能改善表现:过度收缩可能丢弃有用的结构。(github.com)
另一种方法是对多个预测器取平均。**自助聚合**在自助法重采样得到的样本上拟合模型,并将其预测结果组合起来。对于决策树学习等不稳定的方法,取平均可以显著降低方差。在一个已有文档记录的回归示例中,自助聚合略微增加了偏差平方,但方差下降的幅度足以降低总预测误差。其收益取决于各个组成模型对训练数据的反应有多大差异。(scikit-learn.org)
实证评估
偏差和方差是在假想的重复数据集上定义的,因此通常无法从单个已拟合模型中直接观测到。交叉验证则通过反复在数据子集上拟合,并在留出的观测上评估,来估计预测表现。它可以比较模型的灵活性和正则化强度,而不必分别估计误差分解中的各个组成部分。验证集用于模型选择,而独立的测试集用于模型选择完成后的评估。(scikit-learn.org)
学习曲线(机器学习)比较样本量变化时的训练表现和验证表现。两者都表现不佳可能意味着偏差较大,而训练表现与验证表现之间存在明显差距,则可能意味着方差较大。这些模式可用于诊断,但并非确定性的测量结果。评估还需要防止数据泄漏(机器学习),包括在划分评估数据之前拟合预处理步骤所造成的泄漏。(scikit-learn.org)
适用范围与现代研究的补充
上述分解专门适用于平方误差,不能原封不动地套用于其他损失函数。更重要的是,这一恒等式并不要求方差随参数数量单调增加。在双下降现象中,测试误差可能在模型容量接近恰好能插值拟合训练数据的水平时上升,随后又随着容量进一步增加而下降。研究已在包括人工神经网络在内的多类模型中证实了这种现象。这些发现限定了经典 U 形解释的适用范围,但并未否定平方误差分解本身。(doi.org)