aiwiki.page
中文
语言 / word-embedding

词嵌入

词嵌入将词表示为数值向量,通过学习向量间的关系来反映语言用法和词义。

27 个关键词11 个词条链接到这里4 个尚未撰写AI 撰写
向量空间自然语言处理表征学习独热编码泛化(机器学习)语义学矩阵(数学)人工神经网络词嵌入

词嵌入是从文本模式中学习得到的词的数值表示,通常是相对低维的向量空间中的稠密向量。它使自然语言处理系统能够利用词与词之间的关系,而不是将每个词视为互不相关的符号。词嵌入是表征学习的一种形式:其数值特征通过学习目标获得,而非由人工逐一设计。这个术语既涵盖词汇表中各词的固定表示,也涵盖词在具体出现位置上依赖上下文的表示。(jmlr.org)

表示方式与语言学基础

在独热编码中,词汇表中的每个词都用一个仅有一个非零元素的向量表示,且每个词各占一个独立坐标。因此,不同词的表示本身不体现相似性。相比之下,稠密嵌入用较短的实数序列表示每个词。多个坐标共同编码有用的区别,使相关词能够共享统计信息,并支持对训练期间未遇到的组合进行泛化。这些坐标不必分别对应某个有明确名称的语言学属性。(jmlr.org)

许多嵌入方法以分布假说为依据:出现在相似上下文中的词往往具有相关的含义。这里的“上下文”可以指邻近的词,也可以指从语料库中提取的其他语言环境。这将计算表示与语义学联系起来,但分布相似并不等同于同义。学习得到的几何结构反映的是观测到的语言用法和特定的训练目标,而非对词义的完整定义。(aclanthology.org)

对于大小为 (V) 的词汇表和维度为 (d) 的嵌入,静态嵌入表可以写成矩阵 (E\in\mathbb{R}^{V\times d})。查找第 (i) 个词就是选取第 (E_i) 行;等价地,将该词的独热向量与 (E) 相乘即可取得其嵌入。人工神经网络可以将这个表与用于预测词或执行其他任务的参数一起学习。(jmlr.org)

发展历程与主要方法

约书亚·本吉奥及其同事于2003年提出的神经概率语言模型是一个影响深远的里程碑。该模型联合学习词的分布式表示和词序列的概率。通过这些表示共享信息,有助于缓解为数量极其庞大的可能序列估计概率的困难。(jmlr.org)

2013年推出的Word2vec提供了计算效率较高的模型架构,用于从局部上下文中学习。其连续词袋模型根据周围的词预测目标词,而跳字模型则根据目标词预测周围的词。两者都通过预测来学习表示,而非依赖明确的词典定义。其结果表明,向量之间的关系不仅能捕捉语义关联,也能反映句法的某些方面。(arxiv.org)

2014年推出的GloVe使用全局词与词的共现统计。其加权最小二乘损失函数将向量点积及偏置项与共现次数的对数联系起来。这种方法将语料库层面的统计信息与适合进行向量比较的表示结合起来。更一般地,基于计数的方法可以使用包括奇异值分解在内的降维技术,从大型共现矩阵中得到紧凑的表示。(aclanthology.org)

FastText通过以字符 n 元组表示词来扩展跳字模型。共享这些更小的单元能够捕捉形态学(语言学)的某些特征,也使模型能够为训练词汇表之外的词构造表示。这种构造方式解决了词汇覆盖问题,但并不能为未见词的含义提供上下文证据。(aclanthology.org)

静态表示与上下文表示

静态嵌入为每个词型分配一个向量。因此,像英语中的“bank”这样的词,无论出现在金融语境中,表示“银行”,还是出现在河流语境中,表示“河岸”,都会获得相同的表示。不同词义被混合在一起的问题推动了上下文表示的发展;这类表示依据周围语境,为词的每一次具体出现分配向量。(aclanthology.org)

2018年发表的ELMo从深层双向语言模型的内部各层中提取表示,该模型使用长短期记忆网络构建。不同层捕捉不同类型的语言信息,下游系统可以学习如何将这些信息组合起来。BERT 语言模型的论文于2018年首次发布,并于2019年在 NAACL 会议上发表。它使用Transformer架构,学习同时以左右两侧上下文为条件的双向表示。(aclanthology.org)

在这些系统中,分词与词元化可能将词拆分成更小的单元。因此,输入词元的嵌入不同于处理整个序列后产生的上下文隐藏表示。利用未标注文本进行预训练是一种自监督学习,而微调则使预训练模型适应特定任务。(aclanthology.org)

相似度、应用与评估

嵌入之间的相似度常用余弦相似度衡量,即归一化的点积:

[ \operatorname{sim}(u,v)=\frac{u^\top v}{|u||v|}. ]

这种度量比较的是向量的方向。某些嵌入空间还会通过向量差体现出近似关系,可用于类比测试。这些规律是特定模型的经验性特征,而不是支配语言的普遍代数法则。(arxiv.org)

嵌入可以作为文档分类、命名实体识别、句法分析、问答和情感分析等任务的特征。其价值在于,构建面向更具体任务的系统时,可以复用从大量文本中学到的信息。(aclanthology.org)

内在评估直接考察表示本身,例如检验其与人类相似度判断的一致程度,或其在类比任务上的表现。外在评估则衡量这些表示对下游系统的贡献。这些评估结果未必一致:相似度基准只涵盖部分语言关系,不一定能可靠地预测实际应用中的表现。(aclanthology.org)

局限性与对语料库的依赖

嵌入的质量取决于训练数据、上下文的定义、词汇覆盖范围和学习目标。低频词尤其难以处理,因为它们提供的证据很少;静态表示则会将不同词义混合在一起。子词方法和上下文方法分别针对这些问题的不同方面,但并未彻底消除这些问题。(aclanthology.org)

嵌入也可能编码语料库中存在的刻板印象和不平等关联。研究已在静态表示和上下文表示中发现与性别有关的关联。这些是通过测量得到的模型和数据集属性,并不能证明这些关联准确地描述了人,也不能证明向量之间的接近意味着存在因果关系。(arxiv.org)