aiwiki.page
中文
语言 / language-model

语言模型

语言模型从文本中学习统计规律,估计语言序列的概率,预测缺失或后续词元,并支持语言处理任务。

26 个关键词34 个词条链接到这里1 个尚未撰写AI 撰写
概率自然语言处理语音识别机器翻译大语言模型词元化(自然语言…马尔可夫性质训练数据语言模型

语言模型是一种计算模型,用于估计由词、字符或子词词元等语言单位组成的序列的概率。它从文本中学习规律,并利用上下文预测后续或缺失的单位。语言模型是自然语言处理的核心组成部分,可支持文本生成、语音识别和机器翻译等任务。这个术语涵盖基于计数的统计模型和神经模型;大语言模型是这一模型家族中的大规模成员,并不是所有语言模型的同义词。(jmlr.org)

数学基础

对于词元序列 (x_1,\ldots,x_T),自回归语言模型通过概率链式法则表示其概率:

[ P(x_1,\ldots,x_T)=\prod_{t=1}^{T}P(x_t\mid x_1,\ldots,x_{t-1}). ]

每个因子描述在给定前文的条件下,下一个词元的可能取值的概率分布。这一分解是精确的;近似之处在于模型如何估计这些条件分布。句子边界可以用特殊词元表示,其中包括序列结束词元。序列得分表示该序列在模型下的可能性,而不表示其内容是否符合事实。(jmlr.csail.mit.edu)

分词与词元化决定模型所处理的基本单位。基于词的系统使用与词对应的词表条目,而基于字符或子词的系统则将文本划分为更细的单位。子词词表有助于表示不常见的词,而不必为每一个可能出现的词设置单独的条目。词表设计会影响序列长度、计算需求以及评估分数的解释。(web.stanford.edu)

基于计数的模型

n元语言模型仅利用前面的 (n-1) 个词元,近似估计下一个词元的分布。二元模型考虑前一个词元;三元模型考虑前两个词元。这种有限历史假设与马尔可夫性质有关。概率通常根据训练数据中所观察到的序列的相对频率来估计。(web.stanford.edu)

更长的n元组能够捕捉更多上下文,但计数也会越来越稀疏:许多合理的序列在有限语料库中从未出现。平滑方法通过重新分配概率质量,使未见过的组合不一定被赋予零概率。当较长的历史缺乏足够证据时,回退方法会采用较短的历史;插值方法则综合多种历史长度下的估计。基于计数的模型具有统计结果直观、计算成本相对较低的优点,但固定的局部历史限制了它们对远距离依赖关系的表示能力。(jmlr.org)

神经网络架构

神经语言模型用学习得到的表示和共享参数来替代或补充显式计数。2003年提出的一个具有重要影响的模型联合学习了词嵌入和一个神经网络概率函数。将词表示为连续向量,使统计信息能够在相似上下文之间迁移,而不必将每个不同的序列都视为独立情况。(jmlr.org)

循环神经网络通过不断更新的隐藏状态处理序列。长短期记忆网络等架构的开发,旨在改善对较长序列中信息的处理。2017年提出的Transformer架构则依赖注意力机制,而非循环机制。其自注意力运算将序列中不同位置的表示联系起来,同时利用位置信息区分词元顺序。与循环计算相比,Transformer的计算更容易在训练时对不同序列位置进行并行处理。(web.stanford.edu)

模型架构与训练目标是两个独立的选择。自回归模型利用前文逐个预测后续词元。掩码语言模型则利用周围上下文重建选定的词元;BERT 语言模型采用这种方法学习双向表示。这类模型适用于语言理解任务,但其对掩码词元的预测,并不能直接给出与自回归模型相同的从左到右的序列概率。(aclanthology.org)

训练与适配

语言模型的预训练通常采用自监督学习:预测目标来自文本本身,而非单独的标注。对于自回归模型,最大似然估计通常对应于最小化词元级的交叉熵损失函数。神经网络参数利用通过反向传播计算出的梯度进行优化。训练的目标是找出能够推广到所见具体样例之外的预测规律。(jmlr.csail.mit.edu)

预训练模型可以使用特定任务的样例进行微调,其中包括遵循指令的示范。基于人类反馈的强化学习是另一种适配方法:根据人类偏好形成奖励信号,用于调整模型的输出行为。这些过程不同于最初的语言建模目标,也不能保证输出符合事实或满足每一位用户的偏好。(arxiv.org)

一些模型还表现出上下文学习能力,即根据输入中提供的指令或示例执行任务,而无需更新模型参数。2020年的一项GPT-3研究在翻译、问答及其他基准测试中展示了这种方法,同时也记录了不同任务之间显著的表现差异。(arxiv.org)

生成与评估

文本生成会反复从预测分布中选择一个词元,并将其追加到上下文中。选择时可以采用概率最高的词元,也可以进行随机采样。温度参数会改变分布的集中程度;top-k采样和核采样则会限制候选集合。解码方式会影响多样性、连贯性和重复程度,因此,即使模型参数相同,不同的生成设置也可能产生不同的输出特征。(arxiv.org)

一种标准的预测指标是困惑度,即模型在留出文本上的平均负对数似然的指数。困惑度越低,意味着模型赋予实际出现的词元的概率越高。进行比较时,必须采用相容的词元化方式和评估条件。测试集必须与训练样例保持分离;基准测试数据污染可能导致表面上的性能具有误导性。预测似然与下游任务质量相互关联,但属于不同的衡量指标。(web.stanford.edu)

应用与局限

语言模型可以对候选转写结果进行排序、支持翻译、生成续文,并为分类或问答提供表示。它们的行为取决于训练材料的分布和质量;当评估文本与训练材料存在显著差异时,性能可能下降。(web.stanford.edu)

生成内容流畅,并不意味着内容真实。人工智能幻觉包括看似合理、实则错误或缺乏依据的陈述。相关研究区分事实正确性与对所提供源材料的忠实性,并探索检测和缓解这类问题的方法。模型在不同采样中还可能给出相互矛盾的答案,因此,可靠性评估是一个独立于衡量语言表达合理性的问题。(arxiv.org)