分布偏移是指不同环境、群体或时期的数据所遵循的概率分布发生变化或存在差异。在机器学习中,它通常指训练数据与测试或部署时遇到的数据之间的分布差异。这类差异可能降低预测准确性,但分布变化并不一定会损害所有模型的表现。分布偏移关注的是在一种情境中学到的关系在另一种情境中是否仍然有用,因此是泛化(机器学习)的核心问题。(proceedings.mlr.press)
数学表述
在监督学习中,令 (X) 表示输入特征,(Y) 表示预测目标。源分布 (P_s(X,Y)) 描述训练环境,目标分布 (P_t(X,Y)) 则描述预期的应用环境。当这两个联合概率分布不同时,就发生了分布偏移。这是底层分布之间的差异,而不只是从同一分布抽取的有限样本之间通常存在的波动。(sciencedirect.com)
对于预测器 (f) 和损失函数 (\ell),目标风险定义为以下期望值:
[ R_t(f)=\mathbb{E}_{(X,Y)\sim P_t}[\ell(f(X),Y)]. ]
通过经验风险最小化进行训练,通常近似求解的却是源风险。当源分布与目标分布不同时,较低的源风险并不一定意味着较低的目标风险。同样,完全在源分布内进行的交叉验证也可能无法准确估计部署后的性能。(jmlr.csail.mit.edu)
主要类型
一种常见分类区分了输入出现频率、标签出现频率以及输入与预测目标之间关系的变化。这些类别规定了相应的数学假设;现实中的偏移可能同时涉及多种机制,而且不同研究领域使用的术语也有所差异。(sciencedirect.com)
**协变量偏移**发生于以下情形: [ P_s(X)\ne P_t(X),\qquad P_s(Y\mid X)=P_t(Y\mid X). ] 输入的出现频率增加或减少,但给定输入时预测目标的条件概率保持不变。仅仅观察到输入发生变化,并不能证明这种条件关系保持稳定。(jmlr.csail.mit.edu)
**标签偏移**也称先验概率偏移,其假设为: [ P_s(Y)\ne P_t(Y),\qquad P_s(X\mid Y)=P_t(X\mid Y). ] 各类别的比例发生变化,而每个类别内部的输入分布保持稳定。由于类别的先验概率发生了变化,目标分布中的后验概率 (P_t(Y\mid X)) 通常也会改变;因此,标签偏移并不等同于协变量偏移。(proceedings.mlr.press)
概念偏移描述的是 (P(Y\mid X)) 的变化:同样的观测特征在不同情境中具有不同的预测含义。在序列应用中,概念漂移往往更广泛地指分布随时间发生的变化。由于定义不尽相同,“漂移”并不总是专指条件关系的变化。(rtg.cis.upenn.edu)
成因与影响
分布偏移可能源于缺乏代表性的抽样、不同的测量过程、地理差异或群体变化。即使总体保持不变,样本选择机制也可能改变观测样本的分布。环境之间的变化还可能同时影响分布的多个组成部分,而非符合某一种理想化的偏移类型。(sciencedirect.com)
在计算机视觉中,相机位置的差异可能改变图像背景和拍摄条件。在自然语言处理中,部署时可能面对不同的用户或文本领域。遥感系统可能遇到地理和时间上的差异。这些只是应用场景的例子,并不能保证某个特定的条件分布保持不变。(proceedings.mlr.press)
当模型依赖于无法跨环境持续存在的相关关系时,分布偏移的影响尤其显著。借鉴因果推断的方法尝试识别在特定变化下仍保持稳定的预测关系。这些方法是否有效,取决于对数据生成过程以及哪些机制可能发生变化所作的假设。(proceedings.mlr.press)
检测与评估
分布偏移检测将参考数据与新观测到的数据进行比较。方法包括统计假设检验、降维后的检验,以及训练分类器来区分源样本和目标样本。如果能够成功区分数据所属的域,就说明存在分布差异,但这本身并不能衡量相应的预测误差。(proceedings.neurips.cc)
如果没有目标域的标签或额外假设,仅监测输入通常无法识别只发生在 (P(Y\mid X)) 中的变化。同样,检测到输入变化也不能证明模型性能已经下降,因为偏移可能只影响无关特征。因此,检测偏移、刻画偏移以及评估其危害是不同的任务。(rtg.cis.upenn.edu)
评估使用专门设计的测试集,以代表预期的目标环境。将特定地点、机构、群体或时期的数据留作测试,可以揭示随机划分数据时被掩盖的弱点。2021 年推出的 WILDS 基准汇集了十个具有自然发生的分布偏移的数据集。其实验发现,分布内与分布外的性能存在显著差距,专门用于应对分布偏移的方法也不例外。(proceedings.mlr.press)
适应与鲁棒性
在协变量偏移且源分布覆盖充分的条件下,重要性加权为样本赋予与下式成比例的权重: [ w(x)=\frac{p_t(x)}{p_s(x)}. ] 这可以将源分布下的期望转换为目标分布下的期望。该方法要求两个分布具有适当的重叠:如果目标分布的某些区域在源分布中不存在,加权无法提供这些区域的信息。估计较大的密度比还可能增大方差。(jmlr.csail.mit.edu)
在标签偏移假设下,则可以利用类别频率之比进行校正。黑盒偏移估计利用带标签的源数据、无标签的目标数据以及预测器的混淆矩阵,估计变化后的类别比例;这一方法须满足矩阵可逆性等可识别性条件。(proceedings.mlr.press)
域适应利用目标域的信息来改善迁移效果。一种方法通过表征学习获得既有助于预测、又使源样本与目标样本更难区分的表征。分布鲁棒优化则在一组指定的合理分布中最小化最坏情况下的风险。这两种框架都无法抵御不受限制的变化:域适应依赖于连接不同域的假设,而鲁棒性取决于其不确定性集合包含哪些分布。(jmlr.csail.mit.edu)