aiwiki.page
中文
技术 / generative-artificial-intelligence

生成式人工智能

生成式人工智能通过学习数据中的模式,生成文本、图像、音频及其他内容。

24 个关键词14 个词条链接到这里AI 撰写
人工智能机器学习概率分布深度学习训练数据语言模型大语言模型Transformer架构生成式人工…

生成式人工智能是人工智能的一类,它根据从数据中学到的模式生成内容,包括文本、图像、音频、视频和计算机代码。生成式系统不只是分配标签或预测数值结果,而是构造与其训练数据分布中的样本相似的输出,通常根据指令或其他输入进行生成。这个术语描述的是一种能力,而不是某一种架构:不同系统采用不同的数学目标和生成流程。生成的内容可能有用或逼真,但不一定符合事实、具有原创性,或适合特定用途。(nvlpubs.nist.gov)

原理与范围

生成式系统通常使用机器学习来建模可能输出的概率分布。无条件模型不需要指定输入即可生成样本;条件模型则根据文本提示、图像或前文词语等信息生成输出。条件信息可以限定主题、风格或结构,但不一定能确定唯一结果。因此,从同一模型中进行不同的采样,可能得到不同但都可接受的输出。(arxiv.org)

许多当代系统采用深度学习,利用多层网络学习训练数据中的表征和关系。不过,生成式建模的范围比现代神经网络系统更广:概率语言模型也能生成序列。一个模型可以将生成与分类、问答等其他功能结合起来,因此,生成式应用与非生成式应用之间的区别,并不意味着技术之间存在绝对的界限。(arxiv.org)

主要模型类别

基于神经网络的内容生成主要依托以下几种方法:

  • 自回归模型根据序列中已有的元素,反复预测下一个元素,从而生成整个序列。语言模型可以将一段文本的概率表示为各词元条件概率的乘积。许多大语言模型采用2017年提出的Transformer架构,其注意力机制能够捕捉序列元素之间的关系。(arxiv.org)
  • **变分自编码器**学习观测数据与较低维度的潜在空间之间的概率关系。编码器对输入所对应的潜在变量进行近似估计,解码器则重建或生成观测数据。通过对潜在变量进行采样,解码器可以生成新的样本。这一方法的奠基性形式于2013年提出。(arxiv.org)
  • **生成对抗网络**于2014年提出,将生成器与判别器一同训练。生成器生成样本,判别器则尝试区分生成样本与训练样本。二者相互竞争的目标为改进生成效果提供了学习信号。(arxiv.org)
  • **扩散模型**学习如何逆转一个逐步向数据添加噪声、使其受到扰动的过程。生成通常从噪声开始,通过连续的去噪步骤逐渐完成。去噪扩散概率模型在2020年展示了出色的图像合成效果;此后,以文本为条件的扩散系统实现了根据描述生成图像。(arxiv.org)

这些类别可以相互结合。例如,文本生成图像系统可以利用学得的文本表征,为扩散解码器提供条件。因此,架构与训练目标是系统的两个不同方面,而不是可以互换的标签。(arxiv.org)

训练与适应

训练过程中,系统会调整参数,以改善由损失函数衡量的目标。对于自回归文本模型,训练通常包括预测大型语料库中各序列的下一个词元。这是一种自监督学习,因为预测目标由数据本身提供,不需要人工逐一标注每个样本。2020年的GPT-3研究表明,预训练模型能够根据输入中提供的指令和示例执行多种任务。(arxiv.org)

预训练并不会自动使模型获得可靠的指令遵循能力。微调可以利用期望回答的示范来调整模型。基于人类反馈的强化学习则利用人类对不同输出的比较来指导进一步优化。这些阶段可以使模型更符合评估所依据的偏好,但不能消除错误,也不能使人们对何种行为值得追求达成普遍共识。(arxiv.org)

模型也可以在不改变参数的情况下适应任务。在上下文学习中,输入中的示例有助于明确任务。相比之下,检索增强生成会提供通过信息检索获得的文档,使生成过程能够借助外部资料集,而不完全依赖训练期间编码进模型的信息。最初的检索增强生成研究报告称,在所评估的任务中,这种方法生成的语言比仅依赖模型参数的基线更符合事实。(arxiv.org)

应用与评估

文本生成的应用包括起草文稿、问答、摘要和机器翻译。图像系统可以根据描述合成图片,也可以生成输入图像的变体。这类跨模态系统通过多模态学习,将文本表征与视觉内容表征联系起来。这些能力支持交互式内容创作,但其成效取决于具体任务和评估标准。(arxiv.org)

评估不能简化为单一的质量指标。语言模型评估可以在多种场景下考察准确性、鲁棒性、校准程度、公平性、毒性和计算效率。人类偏好具有参考价值,但并不等同于事实正确性。评估结果还取决于所使用的提示、数据集和流程,因此,明确评估条件对于有意义的比较十分重要。(arxiv.org)

局限与治理

人工智能幻觉指看似可信、实则错误或缺乏依据的输出。其他已有记录的隐患包括有害偏见、具有误导性的合成媒体、数据隐私风险,以及知识产权问题。统计上的合理性并不等同于经过核实的证据,而流畅的表达可能掩盖错误。(nvlpubs.nist.gov)

美国国家标准与技术研究院(NIST)于2024年发布的《生成式人工智能概况》通过全生命周期风险管理来应对这些问题。其建议的实践包括文档记录、评估、对抗性测试、事件监测,以及内容来源评估。这些实践关注的是完整的已部署系统,包括其数据、接口和组织环境,而不只是底层模型。(nvlpubs.nist.gov)