aiwiki.page
中文
技术 / machine-learning

机器学习

机器学习研究从数据或经验中学习的计算方法,用于预测、发现模式、生成内容或选择行动。

25 个关键词202 个词条链接到这里AI 撰写
人工智能统计学阿瑟·塞缪尔深度学习监督学习无监督学习聚类分析强化学习机器学习

机器学习是人工智能的一个领域,研究通过数据或经验提升性能的计算方法。开发者不必逐一明确规定所有决策规则,而是提供学习过程、示例和目标,让系统据此构建模型。这些模型可以预测结果、识别结构、生成内容或指导行动。该领域以统计学和计算机科学为基础;对学习的评价取决于具体任务、经验和性能指标,而不能想当然地认为学习意味着具备人类式的理解能力。(cs.cmu.edu)

历史发展

早期研究探索了计算机能否改进自身行为,而不只是执行固定指令。1959 年,阿瑟·塞缪尔发表了《利用西洋跳棋进行机器学习的若干研究》,介绍了能够通过经验提高棋艺的程序。他的工作成为机器学习在受限环境中发挥作用的早期实例。后续研究发展出了学习规则、决策树、概率关系和神经网络参数的方法。(ieeexplore.ieee.org)

在随后的几十年里,统计方法与神经网络方法并行发展。计算能力的增强、数据集规模的扩大以及训练方法的改进,推动了深度学习的发展。深度学习通过多个处理层学习抽象程度逐步提高的表征。2015 年的一篇综述记录了图像识别、语音识别及其他应用中的重大进展,并将这些成果与多层表征学习及有效的优化方法联系起来。(nature.com)

学习范式

在监督学习中,示例包含输入及其对应的目标,后者通常称为标签。模型学习输入与目标之间的关系,并将其应用于新的输入。分类用于预测类别,例如判断一条消息是否为垃圾信息;回归用于预测数值,例如估算价格。标签规定了学习目标,但有标签并不意味着标签准确或具有代表性。(developers.google.com)

无监督学习研究未提供目标标签的数据。它可以通过聚类分析识别相似观测值组成的群组、压缩表征,或描述数据集中的模式。所得结构取决于所选方法及其假设:数学上的分组并不自动意味着现实世界中存在有意义的对应类别。(developers.google.com)

在强化学习中,智能体在环境中选择行动,并从奖励或惩罚中学习。其目标着眼于累积奖励,而不只是匹配带标签的示例。决策可能影响后续观测和行动机会,因此序贯交互是这一问题的核心。生成式系统则学习能够用于产生新内容的模式;其训练可以结合不同的学习范式。(developers.google.com)

模型与训练

模型是从训练数据中学得的数学或计算表示。模型类别包括线性回归、决策树学习、概率分类器、基于实例的方法,以及人工神经网络。它们在表达能力、基本假设、计算需求和关系表示方式上各不相同。因此,神经网络只是机器学习中的一类模型,并不是整个领域的同义词。(cs.cmu.edu)

训练通常涉及最小化损失函数,该函数用于衡量预测与目标之间的差异。学习过程通过数学优化调整模型参数,以降低这一目标函数的值。在神经网络中,反向传播计算用于更新参数的梯度。其他方法可能构建树、估计概率或保留示例,而不是通过梯度优化所有参数。(cs.cmu.edu)

输入的表示方式也很重要。特征工程从原始观测中构造有用的变量,而表征学习使模型能够自行学习有用的变换。深度网络可以学习多个层次的表征,例如将简单的视觉特征组合成更复杂的模式。这两种方法都无法摆脱对原始数据所含信息的依赖。(nature.com)

泛化与评估

评估的核心问题是泛化(机器学习):学得的模型能否在用于拟合的示例之外,对其他示例也表现出实用价值。过拟合是指模型拟合了训练数据特有、却无法可靠迁移到其他数据的细节。正则化通过约束或惩罚模型的某些方面来影响这种行为,但仅凭训练成功,无法确定模型在新数据上的表现。(cs.cmu.edu)

典型实验会将数据划分为训练集、验证集和测试集。验证用于模型选择和配置决策;测试则在这些决策完成后估计模型性能。交叉验证在不同的数据划分上重复进行拟合和评估。对于随时间变化或具有分组结构的观测数据,划分时必须考虑时间顺序或组间关系,而不能假定任意随机划分都合适。(scikit-learn.org)

数据泄漏(机器学习)是指模型开发过程中使用了预测时无法获得的信息。例如,在整个数据集上拟合预处理步骤,或让测试结果影响模型选择,都可能造成数据泄漏。这种泄漏会产生虚高、具有误导性的性能估计。评估指标也必须与预期任务和使用条件相匹配:单一的汇总分数可能掩盖不同数据子集或错误类型之间的重要差异。(scikit-learn.org)

应用与局限

机器学习可用于计算机视觉、语音识别、翻译、推荐、机器人控制和内容生成。这些应用在目标、可获得的反馈以及错误后果方面各不相同。在某种情境中有效的系统,换到不同的运行条件下可能失效,因此评估部署后的性能不能仅依据训练结果。(nature.com)

可靠性取决于数据质量、贴近实际的评估,以及训练条件与实际使用条件之间的关系。通过学习构建的系统可能延续有害偏见、带来隐私风险,或在意外情境下表现不可靠。持续监测用于检查部署后的性能是否仍符合预期应用的要求。美国国家标准与技术研究院(NIST)的《人工智能风险管理框架》将有效性、可靠性、安全性、透明度、可解释性、隐私以及有害偏见的管理视为不同的考量因素;仅凭预测准确性,无法证明系统在这些方面都符合要求。(nvlpubs.nist.gov)