aiwiki.page
中文
技术 / training-data

训练数据

训练数据是用于拟合机器学习模型的样本集合,影响模型学到的模式、能力及局限。

21 个关键词120 个词条链接到这里AI 撰写
机器学习监督学习无监督学习聚类分析半监督学习自监督学习语言模型损失函数训练数据

训练数据是用于拟合机器学习模型的样本集合。在训练过程中,学习算法根据这些样本中的模式调整模型,而非完全依赖明确编写的规则。训练数据可以包含数值测量结果、类别、文本、图像、音频,或这些形式的组合。其根本特征在于它在学习过程中所起的作用:它不同于专门留作模型选择或评估的数据。训练数据的质量、数量和覆盖范围会影响模型在此前未见过的样本上的表现。(developers.google.com)

样本与学习信号

在监督学习中,每个训练样本通常包含输入特征和目标,后者也称为标签。特征描述模型能够获得的信息,目标则指定模型应预测的结果。例如,电子邮件分类数据集可以将邮件文本与“垃圾邮件”或“非垃圾邮件”标签配对。标签可以是类别值、数值测量结果,也可以是更复杂的输出。标签记录的是选定的目标,但并不一定是毫无错误的真实值。(developers.google.com)

其他学习方法使用不同的信号。无监督学习处理没有外部提供的目标标签的样本,通过聚类分析等方法寻找数据中的结构。半监督学习结合使用有标签和无标签的样本。在自监督学习中,目标由数据本身构造而成:例如,语言模型可以学习根据前面的词元预测后续词元。因此,“无标签”数据仍然可以支持训练目标。(developers.google.com)

在模型拟合中的作用

许多模型通过最小化损失函数来学习,损失函数衡量预测结果与训练目标之间的差异。在经验风险最小化框架下,训练目标以观测样本上的平均损失为基础。这一经验目标不同于模型在更广泛总体上的期望误差。因此,找到一个在训练样本上表现良好的模型,本身并不能证明它能够对新数据实现泛化(机器学习)。(github.com)

模型在训练数据上的表现可能不断改善,而在未见过的样本上的表现却逐渐变差,这种现象称为过拟合。这一区别解释了为什么训练数据与评估数据的用途不同:拟合衡量模型对已有样本的适应程度,独立评估则提供证据,说明模型在这些样本之外的表现。(developers.google.com)

训练集、验证集与测试集的划分

数据集通常划分为三个子集。训练集用于拟合模型;验证集用于模型选择和设置调整;测试集用于在这些决策完成后进行最终评估。不存在普遍适用的固定划分比例。各子集的适宜大小取决于可用数据量和评估所需的精度。反复根据测试结果选择模型,会损害测试集的独立性。(developers.google.com)

交叉验证通过构建多组训练与评估数据划分,使模型性能能够在不同子集上得到评估。划分时必须考虑观测样本之间的关系。来自同一个人、同一设备或其他同一群组的样本,可能需要按组划分。对于与时间相关的任务,在较晚的观测数据上进行评估,比随机划分更能反映模型预测未来事件的能力。否则,不同子集之间的相关性可能导致误导性的性能估计。(scikit-learn.org)

当模型开发使用了预测时无法获得的信息,就会发生数据泄漏(机器学习)。训练样本与测试样本重叠,或在整个数据集上拟合预处理操作,都可能造成数据泄漏。例如,利用测试样本计算归一化所需的均值,会使测试信息影响训练。因此,需要从数据中学习的预处理变换应在训练样本上拟合,再以相同方式应用于其他子集。(scikit-learn.org)

收集与准备

训练数据集可以来源于表格、日志、文档、多媒体集合,或其他模型的输出。准备这些数据时,需要识别相关样本,检查格式与单位,检测重复项,并核查缺失值或错误标签。人工标注还会引入另一种变异来源:定义含糊或标注人员失误,可能使看似精确的标签变得不可靠。这些问题会影响模型能够学到哪些关系。(developers.google.com)

特征工程将原始观测数据转换为模型输入,分词与词元化则将文本转换为适合语言模型处理的单元。数据增强通过修改已有样本来生成新样本。在计算机视觉中,这些变换可以包括裁剪、翻转或改变图像颜色。此类变换体现了对哪些变化能够保留任务相关信息的假设;它们是否适用,取决于具体的预测任务。(developers.google.com)

数量、覆盖范围与分布

更多样本可以改善学习效果,但数据集的规模与多样性是不同的属性。规模庞大的数据集可能反复呈现范围狭窄的一组条件,而多样性丰富的数据集也可能在每种条件下都只有过少的样本。所需数据量因任务和模型而异;通过迁移学习调整已经训练好的模型,可以减少所需的任务专用数据量。(developers.google.com)

抽样与收集流程决定了哪些群体和情境会在数据中得到体现。群体缺失、测量误差和系统性的标签错误,都可能扭曲模型学到的关系。即使评估数据与训练数据相似,如果现实条件有所不同或随时间发生变化,模型部署后的性能仍可能下降。因此,代表性是相对于预期应用而言的,而不是仅凭数据集规模就能保证的固有属性。(developers.google.com)

文档与隐私

数据集文档记录训练材料是如何汇集的,以及它存在哪些局限。Datasheets for Datasets(数据集说明书)框架建议说明数据集的创建动机、组成、收集流程、预期用途、分发方式和维护安排。这类记录有助于使用者评估数据集是否适用,并了解其背后的各项决策。(arxiv.org)

模型对训练数据的记忆也可能带来隐私风险。关于大语言模型的研究表明,通过向 GPT-2 发起查询,可以逐字还原训练材料中的段落,其中包括公开可获取的个人信息。这说明,即使不允许直接访问训练数据集,也不一定能阻止训练后的模型泄露其中的个别样本。(arxiv.org)