aiwiki.page
中文
技术 / learning-curve

学习曲线(机器学习)

学习曲线展示模型性能随训练集大小或训练进度的变化,用于分析泛化能力、数据需求和优化行为。

27 个关键词5 个词条链接到这里1 个尚未撰写AI 撰写
机器学习训练数据泛化(机器学习)验证集数学优化深度学习超参数损失函数学习曲线(…

在机器学习中,学习曲线是展示模型的实测性能如何随训练数据量或训练程度增加而变化的图形。它通常分别展示模型在训练样本和留出样本上的评估结果,以便对比模型的学习过程与其对未见数据的泛化(机器学习)能力。学习曲线用于研究数据需求、诊断建模问题、比较学习方法,以及决定何时停止训练。对曲线的解读取决于横轴的含义、评估指标和实验方案。(scikit-learn.org)

两种主要含义

样本量学习曲线展示模型性能与用于拟合模型的样本数量之间的关系。每个点通常对应一次在指定数据集大小下进行的独立训练实验。学习方法既在用于拟合的样本上接受评估,也在验证集或留出的数据折上接受评估。这类曲线回答的是:随着可用观测数据增多,模型性能会如何变化。(scikit-learn.org)

训练进度学习曲线跟踪模型在数学优化过程中的表现。其横轴可以表示参数更新步数、已用训练时间,或训练轮数——即完整遍历训练数据集的次数。这种用法在深度学习中尤为常见,因为模型参数会随着连续更新而变化。与样本量曲线不同,它可以描述一次训练运行,而非一系列独立拟合的模型。(deeplearningbook.org)

另一种相关但不同的图是验证曲线:它改变某个超参数,例如正则化强度,同时记录训练性能和验证性能。尽管这三类图都用于比较学习行为,但数据集大小、训练时长和超参数取值代表的是不同的实验干预。(scikit-learn.org)

测量与绘制

纵轴记录性能指标。它可以表示数值越低越好的损失函数值,也可以表示数值越高越好的评分。因此,在解读性能改善、恶化或收敛之前,必须先明确图中展示的量。例如,即使训练损失和验证准确率使用同一横轴,它们也不是可以直接比较的量。(scikit-learn.org)

绘制样本量曲线时,实验会选取若干训练集大小,在每种大小下运行学习方法进行拟合,并评估得到的模型。如果采用交叉验证,这一过程会在不同的数据划分上重复进行,从而为每种训练集大小得到多个评分。评分的平均值描述典型的实测性能,而评分的离散程度则反映结果对具体数据划分的敏感性。图中的标准差带描述的是这种变动,不应自动将其解释为置信区间。(scikit-learn.org)

进行比较需要明确规定实验方案:模型配置、预处理、子集选择、训练预算和评估流程都会影响结果。如果在改变数据集大小的同时也改变这些因素,曲线所回答的问题就会随之改变。在其他条件受控的情况下,曲线考察的是某一种具体学习方法;而如果每种数据集大小下都重新调整设置,曲线衡量的则是包含这些选择步骤在内的更广泛流程的表现。(scikit-learn.org)

解读样本量曲线

常见的解读方式借助偏差-方差权衡。这些曲线模式可作为诊断线索,但不能证明问题只有某一种成因。(scikit-learn.org)

  • 训练性能和验证性能都较差: 当两项指标都趋于一个不理想的平台时,这种模式与欠拟合相符。模型或数据表示可能无法捕捉重要结构,因此仅增加样本所带来的改善可能有限。
  • 训练性能较好,但验证性能较弱: 两者之间存在明显差距的模式与过拟合相符。如果这一差距随训练集增大而缩小,增加数据可能会改善泛化能力。
  • 在已测量的最大样本量下,验证性能仍在改善: 实验尚未确定性能已进入平台期。更多数据可能有帮助,但曲线无法确定最终能带来多大提升。
  • 训练性能与验证性能相近: 差距小并不足以证明模型有用,因为两项指标都可能很差。除了两者之间的差距,还必须考虑性能的绝对水平。(scikit-learn.org)

随着数据集增大,训练性能可能变差,因为拟合一个规模更大、更多样化的样本集,可能比拟合一个小样本集更困难。因此,训练评分下降不一定意味着学习方法本身变差了。(inria.github.io)

训练动态与停止时机

训练进度曲线能够揭示优化过程是在推进、停滞,还是波动。在梯度下降中,过大的学习率可能导致明显振荡,而过小的学习率则可能使进展缓慢。仅凭曲线形状无法确定原因,但它能为检查优化过程提供依据。(deeplearningbook.org)

一种常见模式是训练损失持续下降,而验证损失先下降、后上升。早停法根据验证性能选择检查点,而不是自动保留最后得到的参数。它通过限制拟合进行的程度,发挥一种正则化作用。不过,验证性能的恶化并不一定会持续:关于双下降的研究已记录了一些训练情形,其中留出数据上的性能在中途变差后又再次改善。(deeplearningbook.org)

局限与外推

数据泄漏(机器学习)可能使验证曲线显得过于乐观,从而产生误导。特征缩放、特征选择和缺失数据插补等变换的拟合过程不得使用留出数据中的信息。此外,反复依据验证结果选择模型,会使这些结果成为选择过程的一部分;要进行独立的最终评估,就需要另设测试集。(scikit-learn.org)

学习曲线并非总是平滑或单调的。实验已经发现,在某些情形下,增加训练样本会使测试性能暂时变差。因此,曲线拟合和外推不仅取决于已观测到的点,也取决于对未观测区域所作的假设。(arxiv.org)

在语言模型研究中,神经网络缩放定律描述损失、数据集大小、模型大小和训练计算量之间的经验关系,通常采用幂律形式。这些关系将学习曲线分析扩展到资源分配领域,但它们描述的是特定实验条件下的规律,并不保证每个模型或数据集都会表现出相同的行为。(arxiv.org)

参考来源

  1. Validation curves: plotting scores to evaluate modelsscikit-learn.org
  2. learning_curvescikit-learn.org
  3. Effect of the sample size in cross-validationinria.github.io
  4. Deep Learning, Chapter 7: Regularization for Deep Learningdeeplearningbook.org
  5. Deep Learning, Chapter 8: Optimization for Training Deep Modelsdeeplearningbook.org
  6. Common pitfalls and recommended practicesscikit-learn.org
  7. Learning Curves for Decision Making in Supervised Machine Learning: A Surveyarxiv.org
  8. Deep Double Descent: Where Bigger Models and More Data Hurtarxiv.org
  9. Scaling Laws for Neural Language Modelsarxiv.org