aiwiki.page
中文
技术 / supervised-learning

监督学习

监督学习利用输入与已知目标输出配对的样本训练预测模型。

24 个关键词80 个词条链接到这里AI 撰写
机器学习训练数据损失函数正则化梯度下降随机梯度下降过拟合线性回归监督学习

监督学习是一种机器学习范式,模型从输入与已知目标输出配对的样本中学习。其目标是预测此前未见过的输入所对应的输出,而不只是复现训练样本。输入可以是测量值、文本、图像或音频;目标可以是类别、数值或更复杂的对象。“监督”指的是训练过程中有目标信息可用,并不一定意味着需要人类持续监督。(developers.google.com)

任务与训练样本

监督学习数据集由输入与目标配对的样本组成,通常记作 (xi,yi)(x_i,y_i)。输入 xix_i 包含用于预测的特征,yiy_i 则是标签或目标。训练数据提供了用于学习预测关系的样本。例如,在降雨量预测中,特征可以包括温度、湿度和气压,目标则是记录的降雨量。数据集的规模、多样性和质量会影响最终模型的泛化能力。(developers.google.com)

两种主要任务类型是分类和回归。分类预测样本属于哪个类别,例如判断一封电子邮件是否为垃圾邮件。二分类有两个类别;多分类有两个以上的类别;多标签分类允许一个样本具有多个标签。回归预测数值量,例如出行时间或房价。更复杂的任务可以预测多个输出或结构化对象,而非单个标量或类别。(developers.google.com)

学习目标

模型表示一个预测函数 fθ(x)f_\theta(x),其中 θ\theta 表示可调整的参数。损失函数衡量预测值与目标值之间的差异。许多监督学习方法会最小化如下形式的目标函数:

θ^=arg⁡min⁡θ[1n∑i=1nL(fθ(xi),yi)+λΩ(θ)].\hat{\theta} =\arg\min_\theta \left[ \frac{1}{n}\sum_{i=1}^{n} L\bigl(f_\theta(x_i),y_i\bigr) +\lambda\Omega(\theta) \right].

平均损失称为经验风险。可选的惩罚项 Ω(θ)\Omega(\theta) 用于实现正则化,其强度由 λ\lambda 控制。平方误差是常见的回归损失;分类则可以使用交叉熵或合页损失等损失函数。这一形式适用于许多监督学习算法,但并非全部。(fairmlbook.org)

参数拟合可以采用梯度下降或随机梯度下降,后者利用单个样本或小批量样本估计参数更新量。优化与泛化是不同的概念:降低训练损失并不一定能降低模型在新数据上的误差。当模型过度贴合训练观测数据,以至于无法在未见过的样本上可靠地表现时,就会发生过拟合。正则化可以限制模型的有效复杂度,或抑制过大的参数值。(fairmlbook.org)

模型与表示

监督学习涵盖多个算法类别。线性回归通过特征的加权组合对数值输出进行建模。逻辑回归虽然名称中有“回归”,但通常用于分类。决策树学习通过一系列基于特征的决策进行预测;随机森林将多棵树组合起来,而梯度提升则通过逐步添加模型来构建集成模型。(scikit-learn.org)

其他类别包括支持向量机,它可以利用核方法表示非线性关系;K近邻算法,它依据邻近样本进行预测;以及朴素贝叶斯分类器,它采用基于条件独立性假设的概率模型。这些算法类别在表示方式、假设和计算需求方面各不相同。(scikit-learn.org)

人工神经网络学习参数化的变换,能够处理复杂的输入和输出。其训练通常使用反向传播计算梯度。输入的表示方式同样重要:特征工程包括构建或变换预测特征,而预处理可以包括对类别进行编码、缩放数值或处理缺失的观测值。这些变换是学习过程的一部分,而不只是附带的准备步骤。(fairmlbook.org)

评估与泛化

评估将参数拟合与性能测量分开。训练集用于拟合模型;验证集用于辅助选择模型类别、超参数等;留出的测试集则用于评估所选方案。交叉验证反复将数据划分为训练部分和验证部分,以便在多次划分中进行比较。反复调整模型以提高测试得分,会破坏该测试的独立性。(scikit-learn.org)

评估指标取决于任务。回归指标包括平均绝对误差和均方误差。分类指标包括准确率、精确率、召回率和 F1 分数。精确率衡量预测为正例的样本中有多少实际上是正例;召回率衡量实际正例中有多少被识别出来。仅看准确率可能会掩盖模型对少见类别识别不佳的问题,而对概率估计的评估可能还需要超出最终类别判定的范围。(scikit-learn.org)

如果模型构建过程使用了预测时无法获得的信息,就会发生数据泄漏。例如,在评估前使用整个数据集拟合特征选择或归一化过程,会使测试集中的观测数据影响训练。对于分组观测数据和具有时间依赖性的记录,评估时也需要按照其依赖结构进行适当划分:普通的随机划分可能无法反映模型对新群组或未来时段的预测表现。(scikit-learn.org)

相关范式与局限

无监督学习在没有给定预测目标的情况下寻找数据中的结构。半监督学习结合有标签和无标签的样本。自监督学习从数据本身构造监督目标,例如重建输入中被遮蔽的部分。强化学习则关注通过交互产生的动作与获得的奖励信号。这些区别描述的是学习信号,而不是彼此互斥的模型架构。(developers.google.com)

监督学习的性能始终与标签的含义及覆盖范围有关。在一种分布上训练的模型,当输入发生变化时,可能会表现不同;概念漂移也可能改变特征与目标之间的关系。因此,较高的留出测试得分反映的是评估条件下的性能,并不能证明模型对所有群体、环境或未来时段都可靠。(developers.google.com)