潜在空间是统计模型或计算模型中未观测变量或内部表征所有可能取值的集合。在机器学习中,它为观测数据提供了另一种描述方式:例如,一幅图像可以用编码其外观特征的坐标来表示,而不是直接用像素来表示。“潜在”意味着这些坐标并不是原始数据中直接观测到的测量值。这一术语既涵盖描述隐藏因素的概率模型,也涵盖表征学习中学到的编码;这些编码的坐标不一定具有可辨识的含义。(deeplearningbook.org)
数学表述
对于观测值 ,确定性编码器生成表征 ,其中 表示学习得到的参数。其潜在空间 是所有可能编码 的取值域。通常,,即具有 个坐标的向量空间,不过模型也可以使用离散变量或具有结构的变量组合。表征的维度往往小于原始输入,但维度降低并不是潜在空间的定义条件:过完备表征的坐标数可以多于输入的坐标数。(deeplearningbook.org)
在概率表述中, 是一个随机变量,模型规定了一个联合概率分布:
这里, 是先验分布,而 描述给定潜在状态时观测值的条件分布。对 积分将其消去,即可得到观测数据的分布;若 为离散变量,则对其所有可能取值求和。反过来,根据观测值推断 ,涉及的是后验分布 。因此,推断与生成沿着相反方向,利用观测值与潜在变量之间的关系。(arxiv.org)
潜在表征的学习
潜在表征可以通过线性方法构建,也可以通过非线性模型学习。主成分分析选取方差最大的若干方向,以这些方向上的坐标表示中心化后的观测值。其降维表征位于一个线性子空间中。相比之下,非线性编码器能够捕捉观测值与其表征之间更复杂的关系。(deeplearningbook.org)
自编码器采用编码器—解码器架构:编码器将 映射为编码 ,解码器则生成重建结果 。训练过程会最小化重建损失函数,也可能同时施加额外约束。狭窄的瓶颈有助于实现降维;即使没有狭窄瓶颈,稀疏性约束、基于噪声的训练以及其他形式的正则化也能促进模型学习有用的表征。仅凭重建质量,无法证明编码捕捉到了具有解释意义的因素。(deeplearningbook.org)
变分自编码器赋予编码明确的概率解释。其编码器通常给出近似后验分布 ,而不只是单个点。训练时通常最大化证据下界:
第一项奖励模型对观测值的解释能力;第二项是KL散度,用于惩罚对先验分布的偏离。标准正态分布是常用的先验选择,但并非必需。(arxiv.org)
几何与插值
潜在空间具有坐标系,但仅凭坐标并不能确定一种有用的相似性度量。欧几里得距离对所有坐标方向一视同仁;然而,非线性解码器可能将潜在空间中相等的位移转化为输出中差异很大的变化。因此,不应将几何上的接近与语义上的相似视为等同的性质。(proceedings.mlr.press)
对于可微解码器 ,其雅可比矩阵可以诱导局部度量:
当适当的正则性条件和秩条件成立时,这一度量描述了从输出空间继承的长度,并将潜在表征与微分几何联系起来。在该度量下,测地线不一定是潜在坐标中的直线。(openaccess.thecvf.com)
插值用于计算两个端点之间的中间编码。线性插值采用 ;考虑几何结构的方法则可以沿曲线路径进行插值。视觉上平滑的过渡可以揭示生成器学到的结构,但无论是平滑性,还是看似合理的端点,都不能保证中间输出沿着学习到的数据流形变化,或保持某个特定属性。(proceedings.mlr.press)
生成模型与应用
在生成对抗网络中,生成器将采样得到的潜在输入转化为合成观测值。最初的框架通过生成器与判别器之间的竞争来学习这一映射,并不要求有一个将观测值映射回潜在编码的编码器。因此,潜在空间不一定要通过压缩或重建来构建。(arxiv.org)
潜在空间中的计算也通过潜在扩散模型支持生成式人工智能。这类系统先学习自编码器表征,再在该表征空间中训练扩散模型,最后将生成的潜在表征解码为图像。将去噪过程从全分辨率像素空间移至潜在空间可以降低计算需求,而表征则需要在压缩程度与视觉细节保留之间取得平衡。条件机制可以纳入文本或其他输入。(openaccess.thecvf.com)
除生成之外,学习到的表征还可以支持预测,以及跨任务或跨模态的迁移。其效用取决于保留了哪些信息,以及使下游模型能够辨别哪些差异;适合重建的表征并不一定对所有预测任务都是最优的。(deeplearningbook.org)
可解释性与可辨识性
解耦表征旨在将变化背后的因素分离到不同坐标或坐标组中。这比仅仅获得紧凑编码提出了更强的要求。在一类宽泛的潜变量假设下,对隐藏变量进行不同变换仍可能解释同一个观测分布,因此仅凭观测数据,可能无法唯一辨识出所期望的因素。关于无监督学习的研究表明,如果不对模型和数据作出额外假设,通常无法恢复解耦表征。因此,将坐标标为“姿态”或“风格”等需要证据支持,这些含义并非潜在空间固有的属性。(proceedings.mlr.press)