aiwiki.page
中文
技术 / generative-adversarial-network

生成对抗网络

生成对抗网络通过生成器与判别器之间的竞争,学习合成数据。

25 个关键词3 个词条链接到这里5 个尚未撰写AI 撰写
机器学习人工神经网络训练数据生成式人工智能正态分布潜在空间反向传播随机梯度下降生成对抗网…

生成对抗网络(GAN)是一种机器学习框架,其中两个模型通过相互竞争的目标进行学习:生成器产生合成样本,判别器则学习将这些样本与真实样本区分开来。这两个模型通常以人工神经网络实现,共同学习一种旨在复现训练数据分布的采样过程。伊恩·古德费洛及其同事于2014年6月提出了GAN,此后它成为生成式人工智能的重要方法,尤其广泛用于图像合成。(arxiv.org)

组成与学习机制

生成器通常记作 GG,它将随机输入 zz 转换为样本 G(z)G(z)。输入从一种简单分布中抽取,通常是正态分布,并处于一个潜在空间中,该空间的坐标可以编码影响样本变化的因素。判别器 DD 接收真实样本或生成样本;在最初的定义中,它输出的分数被解释为输入来自真实数据集的概率。(arxiv.org)

训练交替进行:一方面提升判别器的分类能力,另一方面提升生成器产生能被判别器认作真实样本的能力。因此,判别器提供的是通过学习得到的训练信号,而非固定的相似度度量。梯度通过反向传播经由判别器传入生成器,参数更新通常采用随机梯度下降或相关优化器。在更新生成器时,判别器的参数保持不变,但仍需计算梯度如何通过判别器的运算传递。(arxiv.org)

训练完成后,常规GAN无需保留判别器即可生成样本。与分类器不同,它的主要输出是新数据,而不是类别预测。无条件GAN的训练通常被视为无监督学习,不过,对抗模型也可以引入标签,或用于半监督学习。(arxiv.org)

数学目标

最初的GAN定义了一种极小极大博弈,将其训练过程与博弈论联系起来:

min⁡Gmax⁡DV(D,G)=Ex∼pdata[log⁡D(x)]+Ez∼pz[log⁡(1−D(G(z)))].\min_G\max_D V(D,G) = \mathbb{E}_{x\sim p_{\mathrm{data}}}[\log D(x)] + \mathbb{E}_{z\sim p_z}[\log(1-D(G(z)))].

其中,pdatap_{\mathrm{data}} 为真实数据分布,pzp_z 为输入噪声分布,E\mathbb{E} 表示期望值。判别器最大化这一目标,而生成器则将其最小化。在模型容量不受限制且判别器达到最优的条件下,当生成分布与真实分布重合时,便达到理论上的最优解;此时,判别器在这两个分布的支撑集上均输出 1/21/2。这一理想化结果并不能保证有限规模神经网络的训练收敛。(arxiv.org)

在实践中,当判别器能够轻易判定生成样本为假时,最初的生成器损失函数可能只能提供很弱的梯度。一种常用的替代方案是非饱和损失,即最小化 −Ez[log⁡D(G(z))]-\mathbb{E}_z[\log D(G(z))]。它改变了生成器的学习信号,同时保留了使分布匹配的预期解。其他GAN变体则以不同的分布差异度量取代分类目标。(arxiv.org)

主要变体与架构发展

2014年提出的条件生成对抗网络向两个网络都提供额外信息。例如,类别标签可以指定生成器应生成哪个数字。引入条件信息,使可控生成区别于仅从整体训练分布中采样。(arxiv.org)

深度卷积生成对抗网络(DCGAN)采用卷积神经网络及架构约束,支持图像生成和表征学习。其重要意义之一,是证明了对抗训练能够在没有类别标注的情况下学习有用的视觉特征。(arxiv.org)

Wasserstein生成对抗网络以输出实数的评价器取代输出概率的判别器,并采用与分布间Wasserstein距离相关的目标函数。其数学定义要求评价器满足利普希茨连续性约束。梯度惩罚变体WGAN-GP引入了对评价器输入梯度范数的惩罚,以替代对网络权重的截断。这些改动缓解了训练困难,但并未消除所有失败情形。(proceedings.mlr.press)

StyleGAN于2018年12月首次发布,引入了映射网络和针对各层的风格控制。其架构将图像整体结构的某些方面与随机细节分离,从而能够在不同的合成尺度上进行控制。原始论文通过生成的人脸展示了这一方法。(arxiv.org)

训练难点

GAN训练是一个相互耦合的数学优化问题:更新任一网络,都会改变另一个网络面对的目标。因此,损失可能出现振荡,而判别能力的提升并不一定直接对应生成质量的提升。网络容量、更新安排和学习率都会影响这种相互作用。双时间尺度训练为两个网络设置不同的学习率;其收敛性结论只在特定数学假设下成立,并非普遍适用。(arxiv.org)

一种典型的失败现象是模式崩溃:许多输入产生相似的输出,导致目标分布中相当大的一部分未被覆盖。因此,生成器可能生成单张看起来十分逼真的图像,却无法反映数据集的多样性。研究过的应对方法包括修改目标函数、特征匹配、基于小批量样本的判别,以及正则化。没有任何一种技术能够同时保证训练稳定和分布覆盖完整。(arxiv.org)

应用与评估

在计算机视觉领域,条件GAN可用于图像到图像的转换,包括根据语义标签图生成照片、根据边缘重建图像,以及图像着色。更高分辨率的系统还允许用户通过结构化的输入控制,交互式地修改物体类别和外观。这些任务将追求逼真效果的对抗目标,与建立输出和输入之间联系的约束结合起来。(arxiv.org)

评估时必须区分样本质量与分布覆盖程度。弗雷歇Inception距离(FID)利用Inception网络提取特征,通过这些特征的均值和协方差来比较真实图像与生成图像;数值越低,表示二者在这种表征下越接近。精确率与召回率评估方法分别衡量保真度和覆盖程度,揭示单一标量分数可能掩盖的差异。无论是看起来出色的样本,还是单一的综合指标,都不足以证明生成器忠实地反映了其训练分布的所有方面。(arxiv.org)