aiwiki.page
中文
技术 / generative-pre-trained-transformer

生成式预训练Transformer

生成式预训练Transformer是通过训练来预测和生成序列的模型,也是GPT语言模型家族的基础。

26 个关键词4 个词条链接到这里2 个尚未撰写AI 撰写
语言模型Transformer架构大语言模型生成式人工智能迁移学习自然语言处理微调(深度学习)编码器–解码器架…生成式预训…

生成式预训练Transformer(GPT)是一类语言模型,利用Transformer架构学习文本中的模式并生成后续内容。其核心方法是先在大规模文本集合上进行生成式预训练,再针对具体任务进行适配或提供提示。这个名称尤其与OpenAI的GPT模型家族相关,该家族始于2018年推出的模型。GPT模型已成为大语言模型和生成式人工智能的重要技术路线。(openai.com)

名称含义与历史发展

名称中的三个部分描述了相互补充的特征。生成式指对序列进行建模,以便生成新的后续内容。预训练表示在针对具体任务进行适配之前,先开展一个具有广泛适用性的初始训练阶段。Transformer则指所采用的神经网络架构。最初的GPT研究将迁移学习应用于自然语言处理:语言模型先从无标签文本中学习,再利用各项任务的带标签样例进行微调。(cdn.openai.com)

其架构基础出现在2017年的论文《Attention Is All You Need》中。该论文提出的Transformer以注意力机制而非循环机制作为序列处理的核心。OpenAI于2018年6月11日公布了最初的生成式预训练研究,展示了该方法在文本蕴含、问答和文档分类等任务上的改进。(arxiv.org)

2019年2月14日公布的GPT-2将这一方法扩展到约15亿参数的模型,其训练文本来自800万个网页。相关研究着重展示了如何以文本为条件,在不进行任务专门训练的情况下完成任务。2020年的GPT-3论文介绍了一个拥有1750亿参数的模型,并系统评估了在输入中提供指令和示例时的任务表现。2023年的GPT-4技术报告将这一模型家族扩展到多模态模型,能够接受图像和文本输入,并输出文本;报告未披露模型规模或详细架构。上述模型是这一发展过程中的里程碑,并非完整的模型清单。(openai.com)

架构与序列表示

最初的GPT和GPT-2采用仅解码器的Transformer。与原始Transformer的编码器—解码器架构不同,这种结构处理单一序列,不设置独立的编码器。文本首先经过分词与词元化,形成离散单元,这些单元可以表示单词、单词片段或其他字符序列。GPT-2采用字节级字节对编码,使文本表示无需依赖由完整单词构成的固定词表。(cdn.openai.com)

词元被映射为通过训练学得的向量,并与其在序列中的位置信息结合。堆叠的模块依次执行多头注意力、前馈变换、残差连接和归一化。在每个模块内,因果自注意力使各个位置无法关注后续位置。因此,用于预测某个词元的表示依赖于前文,而非该词元之后的内容。位置编码提供了注意力机制本身并不具备的顺序信息。(arxiv.org)

这与最初的BERT 语言模型不同,后者利用两侧的上下文预测被遮蔽的词元,从而学习双向表示。GPT的因果建模目标直接支持从左到右的生成,而BERT最初的训练目标侧重于上下文表示,而非按序续写。(arxiv.org)

预训练目标

GPT预训练通常采用自监督学习:预测目标来自文本本身,而不是另行提供的人工标签。对于词元序列 x1,…,xTx_1,\ldots,x_T,自回归模型将其概率分解为

P(x1,…,xT)=∏t=1TP(xt∣x1,…,xt−1).P(x_1,\ldots,x_T)=\prod_{t=1}^{T}P(x_t\mid x_1,\ldots,x_{t-1}).

训练旨在最大化观测序列的似然,等价于最小化其负对数似然。这通常表示为针对下一词元预测的交叉熵损失函数。(cdn.openai.com)

训练数据决定了模型能够学习哪些语言模式、主题和风格。模型通过反向传播,使用基于梯度的优化方法调整参数。因果掩码使训练时能够同时计算多个位置的预测,但常规生成仍需按顺序进行,因为每个新生成的词元都会成为预测下一个词元的上下文。(cdn.openai.com)

有关神经网络缩放定律的研究记录了语言模型损失、参数数量、数据集规模和训练计算量之间的经验关系。这些关系涉及特定实验条件下测得的预测表现,并不能证明扩大模型规模就必然保证事实准确,或保证模型胜任所有任务。(arxiv.org)

适配与生成

预训练后的GPT可以通过在任务样例上进行监督学习来适配任务。另一种方式是上下文学习,即在输入中提供指令或示范,同时保持模型参数不变。GPT-3的评估根据所提供示范的数量,区分了零样本、单样本和少样本情境。因此,通过提示指定任务不同于微调,后者会更新模型权重。(arxiv.org)

遵循指令的模型还可能利用人类编写的示范和偏好数据进行额外训练。InstructGPT结合了监督微调、根据输出排序训练的奖励模型,以及基于人类反馈的强化学习。这些后训练过程会改变模型行为,但并非生成式预训练本身的必要条件。(arxiv.org)

生成时,提示作为条件决定下一词元的概率分布。解码过程从中选择或采样一个词元,将其附加到序列末尾,再重复这一过程。不同的采样方式可能使同一提示产生不同的后续内容。以文本为条件的应用包括问答、摘要、机器翻译和对话。(cdn.openai.com)

局限与评估

GPT的输出可能十分流畅,却包含缺乏依据或不实的陈述,这类问题通常称为人工智能幻觉。GPT-4报告记录了模型在基准测试表现有所提升的同时,仍存在幻觉、推理错误以及对输入敏感等问题。人类反馈训练能够减少某些不良输出,但无法将其彻底消除。(arxiv.org)

评估还必须区分真正的任务能力与预训练期间接触过测试材料所带来的表现。GPT-3研究考察了其训练语料与评估数据集之间的重叠,并指出数据污染是一个方法论问题。因此,报告中的结果取决于数据集的构建方式、提示条件和所采用的衡量指标,而不能视为衡量模型能力的单一通用标准。(arxiv.org)