人工神经网络(artificial neural network,简称 ANN)是一种由相互连接的处理单元组成的计算模型,其数值参数决定了输入如何转换为输出。这类网络广泛用于机器学习,在概念上受到生物神经元的启发,但通常并不是对神经系统的精细模拟。它们能够学习中间表征,而不必完全依赖人工指定的特征。具有多个学习型处理阶段的网络是深度学习的核心。(deeplearningbook.org)
历史发展
1943 年,沃伦·麦卡洛克和沃尔特·皮茨描述了由理想化的“全或无”单元组成的网络,并展示了这些单元的活动如何实现逻辑运算。他们的模型建立了神经组织与计算之间的数学联系,但并不是现代意义上用数据训练的网络。随后,弗兰克·罗森布拉特在 20 世纪 50 年代开发了感知机,提出了一种通过学习连接权重来进行分类的方法,产生了深远影响。(doi.org)
1986 年,戴维·鲁梅尔哈特、杰弗里·辛顿和罗纳德·威廉斯发表论文,展示了如何通过误差传播训练隐藏单元,使其表征有用的特征。这项工作推动了多层网络学习成为切实可行的研究方向,不过,基于梯度的误差传播此前已有先例。2012 年,AlexNet结合 GPU 计算、非线性单元和随机失活,展示了大型卷积网络在 ImageNet 分类任务中的有效性。2017 年的 Transformer 论文提出了一种用于序列转换的注意力架构,不采用循环层或卷积层。(nature.com)
单元、层与表征
一种常见的人工单元采用以下计算方式:
其中, 为输入, 为连接权重, 为偏置参数, 为激活函数。非线性激活使连续的网络层能够表达纯仿射模型无法表达的关系。如果中间没有非线性运算,一连串仿射变换的结果仍然是仿射变换。(deeplearningbook.org)
在前馈网络中,信息从输入层经过隐藏层传递到输出层,不存在有向环。多层感知机通常采用全连接层。深度描述连续处理阶段的数量,宽度则描述一层中单元的数量。学习得到的隐藏单元激活值构成表征,供后续层加以组合,从而形成表征学习的基础。(deeplearningbook.org)
通用逼近定理表明,只要容量足够,某些网络就能以任意精度逼近紧致域上的连续函数。这些结论说明的是表征能力上的可能性,并不保证训练过程能找到所需参数,也不保证模型在已观测数据之外的预测准确性。(deeplearningbook.org)
学习与推理
训练过程利用训练数据和既定目标来调整参数。在监督学习中,样本包含目标输出,例如类别标签或数值测量结果。自监督学习从数据本身构造学习目标,而无监督学习可以在没有外部提供的标签时寻找数据中的结构。因此,神经网络是一类模型,而不是某一种学习方法。(deeplearningbook.org)
损失函数衡量输出与训练目标之间的差异。反向传播沿计算过程反向应用链式法则,高效计算损失对各参数的导数。它负责计算梯度,而参数更新由优化器执行。随机梯度下降及相关方法通常使用小批量数据而非整个数据集来估计更新量。学习率、初始化方式和数值条件都会影响训练过程。(nature.com)
训练完成后,神经网络推理将学习得到的计算过程应用于输入。在常规部署中,生成输出本身并不会更新权重。这将可能耗费大量资源的参数学习过程与反复进行的预测区分开来,不过,有些系统也会引入额外的适应机制。(deeplearningbook.org)
主要架构
不同架构体现了对数据组织方式的不同假设:
- **卷积神经网络**在空间或时间网格上应用共享滤波器。局部连接和参数共享使其适用于图像及其他结构化信号。(deeplearningbook.org)
- **循环神经网络**在序列的不同位置之间保留状态,并在连续步骤中共享参数。长短期记忆网络利用门控和记忆状态,帮助建模较长序列中的依赖关系。(deeplearningbook.org)
- **Transformer架构**利用注意力机制组合来自序列不同位置的信息。其原始架构将注意力与逐位置的前馈层及位置信息相结合,使训练过程中能够进行大量并行计算。(arxiv.org)
- **自编码器**学习对输入进行编码并重建输入。对表征或训练目标施加约束,可以促使其捕捉有用的结构,而不是简单地原样复制每个输入。(deeplearningbook.org)
这些类别并不相互排斥:较大的系统可以组合卷积、循环、基于注意力的组件以及全连接组件。(deeplearningbook.org)
泛化与局限
评估的核心问题是泛化(机器学习),即模型在此前未见过的样本上的表现。网络可能出现过拟合:虽然训练误差很低,却学到了无法迁移到新样本的模式。正则化方法包括参数惩罚、数据增强、提前停止,以及在训练期间随机抑制部分激活值的随机失活。验证集用于辅助模型选择,而独立的测试集则用于估计完成这些选择后模型的表现。(deeplearningbook.org)
大型网络可能需要大量计算资源、内存和数据;图形处理器能够加速其中的许多数值运算。预测效果仍取决于具体任务,较低的训练损失并不能证明模型在陌生输入上也会可靠运行。网络还可能容易受到对抗样本的影响:这些刻意构造的扰动在人类观察者看来可能很小或不易察觉,却会导致错误预测。这种现象表明,学习得到的决策边界不一定与人类的感知判断一致。(proceedings.neurips.cc)