Skip to main content
QUICK REVIEW

[论文解读] Autoencoding Generative Adversarial Networks

Conor Lazarou|arXiv (Cornell University)|Apr 11, 2020
Generative Adversarial Networks and Image Synthesis参考文献 11被引用 5
一句话总结

本文提出自编码生成对抗网络(AEGAN),一种四网络架构,结合生成对抗网络(GAN)与自编码器,学习潜在空间与数据流形之间的双射映射。通过在生成图像和潜在向量上同时施加对抗损失与重建损失,AEGAN 稳定了训练过程,防止了模式崩溃,并实现了真实样本之间的直接插值,实验基于动漫人脸数据集验证,样本质量与结构一致性均得到提升。

ABSTRACT

In the years since Goodfellow et al. introduced Generative Adversarial Networks (GANs), there has been an explosion in the breadth and quality of generative model applications. Despite this work, GANs still have a long way to go before they see mainstream adoption, owing largely to their infamous training instability. Here I propose the Autoencoding Generative Adversarial Network (AEGAN), a four-network model which learns a bijective mapping between a specified latent space and a given sample space by applying an adversarial loss and a reconstruction loss to both the generated images and the generated latent vectors. The AEGAN technique offers several improvements to typical GAN training, including training stabilization, mode-collapse prevention, and permitting the direct interpolation between real samples. The effectiveness of the technique is illustrated using an anime face dataset.

研究动机与目标

  • 解决生成建模中 GAN 训练不稳定与模式崩溃的长期挑战。
  • 通过学习数据与潜在表示之间的双射映射,实现潜在空间的有意义分析。
  • 通过将数据编码到解耦的连续潜在空间,实现真实数据样本之间的直接插值。
  • 结合自编码器与 GAN 的优势,提升样本质量与训练稳定性。
  • 提供与先进 GAN 技术兼容的框架,以支持未来可扩展性与应用。

提出的方法

  • AEGAN 框架由四个网络组成:编码器 E、生成器 G、判别器 D_x,以及从潜在空间反向映射到数据空间的反向生成器 G_z。
  • 在生成图像(G(E(x)) ≈ x)与重建潜在向量(E(G(z)) ≈ z)上同时施加重建损失,确保双向重建保真度。
  • 通过对抗损失训练生成器与判别器,使其在极小化极大博弈中最小化真实数据分布与生成数据分布之间的 Jensen-Shannon 散度。
  • 训练目标结合对抗损失与重建损失,通过超参数 λ_rx 与 λ_rz 平衡各项损失的贡献。
  • 该架构受 CycleGAN 启发,但通过使用学习得到的潜在空间 Z 而非第二个数据域 Y,实现了泛化。
  • 双射映射确保每个真实样本唯一映射到一个潜在向量,反之亦然,从而实现可逆且可解释的表示。

实验结果

研究问题

  • RQ1基于 GAN 的模型是否可通过在数据空间与潜在空间同时引入重建约束,实现稳定训练?
  • RQ2在训练过程中,强制双向重建是否能防止 GAN 的模式崩溃?
  • RQ3能否通过 GAN 框架中的潜在空间操作,实现真实数据样本之间的直接插值?
  • RQ4与标准 GAN 相比,引入自编码组件如何影响样本质量?
  • RQ5双射映射在多大程度上实现了潜在空间中解耦且可解释的表示?

主要发现

  • AEGAN 在 300,000 步训练中保持稳定,而基线 GAN 在五次独立训练运行中全部发生完全模式崩溃。
  • AEGAN 重建样本的模糊程度显著低于标准自编码器,能准确还原发色、脸型与眼睛形状。
  • 该模型成功实现了真实动漫人脸之间的平滑插值,包括发色、姿态与面部特征的过渡,在大多数情况下无伪影。
  • 尽管存在局限性,AEGAN 在插值过程中保持了眼睛颜色的一致性,表明该属性缺乏解耦性,且在重建眼镜与男性特征面部时表现不佳。
  • AEGAN 的生成器在不依赖批量归一化或如 WGAN 等高级技术的情况下,仍能生成逼真样本,表明重建约束本身提供了内在稳定性。
  • 该框架与先进 GAN 技术(如 StyleGAN)兼容,可通过引入条件潜在空间扩展至产品可视化等应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。