数学定义
设 x 表示观测数据,z 表示未观测变量,θ 表示模型参数。联合概率分布写为
pθ(x,z)=pθ(x∣z)pθ(z),
其中,pθ(z) 是先验分布,pθ(x∣z) 给出似然函数。计算证据需要对 z 进行边际化:
pθ(x)=∫pθ(x,z)dz.
对于离散变量,积分改为求和。精确的后验分布为 pθ(z∣x)=pθ(x,z)/pθ(x)。即使联合密度可以求值,这些量的计算仍可能十分困难。(cs.columbia.edu)
对于近似分布 q(z),定义
L(q,θ;x)=Eq[logpθ(x,z)−logq(z)].
这里,Eq 表示在分布 q 下的期望值。其定义关系为
logpθ(x)=L(q,θ;x)+DKL(q(z)∥pθ(z∣x)).
由于KL散度非负,因此 L≤logpθ(x)。等号成立当且仅当近似后验分布与精确后验分布几乎处处相同。这个恒等式要求证据为正且有限,并且相关期望有适当的定义;若支持集不相容,ELBO 则可能为负无穷。(cs.columbia.edu)
推导与等价形式
将后验分布代入散度,即可得到上述分解:
DKL(q∥pθ(z∣x))=Eq[logq(z)−logpθ(z∣x)]=Eq[logq(z)−logpθ(x,z)]+logpθ(x).
整理后便得到 ELBO 恒等式。另一种推导方式是:当 q 覆盖联合分布在 z 上的支持集时,对凹函数对数应用詹森不等式,可得
logEq[q(z)pθ(x,z)]≥Eq[logq(z)pθ(x,z)].
此时,左侧就是 logpθ(x)。(cs.columbia.edu)
以下两种等价表达式突出了不同的解释:
L=Eq[logpθ(x,z)]+H(q)
以及
L=Eq[logpθ(x∣z)]−DKL(q(z)∥pθ(z)).
第一种将对数联合密度的期望与信息熵相结合;对于连续变量,H(q) 为微分熵。第二种则在数据拟合程度与偏离先验的程度之间进行权衡。ELBO 的负值通常称为变分自由能,不过不同领域采用的符号约定有所不同。(arxiv.org)
优化与期望最大化
固定 θ 时,在分布族 Q 上最大化 ELBO,等价于最小化 DKL(q∥pθ(z∣x))。因此,推断转化为数学优化问题。若分布族受到限制,即使达到其全局最优解,下界与对数证据之间仍可能存在非零差距。(jmlr.org)
一种常见选择是因子化分布族,也称为平均场分布族,即 q(z)=∏jqj(zj)。坐标上升更新在固定其他因子的同时,优化其中一个因子:
logqj∗(zj)=Eq−j[logpθ(x,z)]+常数.
该常数用于使因子归一化。精确执行这些更新可以提高目标函数值,但通常不保证找到全局最大值。(jmlr.org)
期望最大化算法也可以作同样的变分解释。其 E 步将 q 设为当前的精确后验,使下界达到对数证据。其 M 步通过调整 θ 提高下界,从而提高或保持观测数据的对数似然。变分 EM 则对 q 加以限制,在无法进行精确推断时允许采用近似 E 步。仅仅提高一个不紧的下界,并不能保证真实证据也随之提高。(cs.toronto.edu)
神经网络模型与随机计算
在变分自编码器中,推断网络给出 qϕ(z∣x),生成网络则定义 pθ(x∣z)。两组参数都通过 ELBO 进行优化。对数似然的期望通常称为重构项,而相对于先验的散度起到正则化作用。将负 ELBO 作为损失函数并使其最小化,表达的是同一个优化问题。(arxiv.org)
重参数化技巧可以构造可微的采样过程,例如
z=μϕ(x)+σϕ(x)⊙ϵ,ϵ∼N(0,I),
其中,⊙ 表示逐元素乘法。这使得通过采样得到的潜变量估计梯度成为可能。自动微分与随机梯度下降等方法支持可扩展的优化;随机变分推断还利用数据子采样,对大规模数据集进行模型拟合。(arxiv.org)
解释与局限
精确的 ELBO 是一个下界,但由于采样波动,基于有限样本的随机估计值可能超过对数证据。因此,在数值优化中,需要区分数学上的目标函数与其带噪声的估计值。(arxiv.org)
近似结果也取决于散度的方向。最小化 DKL(q∥p) 可能倾向于使近似分布集中在后验的某个众数附近;因子化则可能削弱变量间的依赖关系,并低估不确定性。因此,ELBO 较高本身并不能证明后验不确定性得到了准确刻画。(cs.columbia.edu)
重要性加权目标通过在对数内部对多个重要性权重取平均,扩展了这一构造。这类目标在期望意义下给出的下界不比单样本 ELBO 更松,并且能够更好地适应复杂的后验分布。不过,它们仍是不同的目标函数:证据下界是否更紧,与优化表现是否更好,是两个不同的问题。(arxiv.org)