Skip to main content
QUICK REVIEW

[论文解读] Image Generation and Editing with Variational Info Generative AdversarialNetworks

Mahesh Gorijala, Ambedkar Dukkipati|arXiv (Cornell University)|Jan 17, 2017
Generative Adversarial Networks and Image Synthesis参考文献 4被引用 8
一句话总结

本文提出变分信息生成对抗网络(ViGAN),一种结合变分自编码器(VAEs)与信息生成对抗网络(InfoGAN)的生成模型,用于联合建模图像及其视觉描述。通过整合具有解耦性、可解释性的潜在编码的推理网络,ViGAN 实现了条件图像生成与基于属性的图像编辑,同时生成的样本比 VAE 更清晰,潜在表示的解耦性也优于标准 GAN。

ABSTRACT

Recently there has been an enormous interest in generative models for images in deep learning. In pursuit of this, Generative Adversarial Networks (GAN) and Variational Auto-Encoder (VAE) have surfaced as two most prominent and popular models. While VAEs tend to produce excellent reconstructions but blurry samples, GANs generate sharp but slightly distorted images. In this paper we propose a new model called Variational InfoGAN (ViGAN). Our aim is two fold: (i) To generated new images conditioned on visual descriptions, and (ii) modify the image, by fixing the latent representation of image and varying the visual description. We evaluate our model on Labeled Faces in the Wild (LFW), celebA and a modified version of MNIST datasets and demonstrate the ability of our model to generate new images as well as to modify a given image by changing attributes.

研究动机与目标

  • 开发一种生成模型,联合学习图像与视觉描述表示,以提升解耦性与可解释性。
  • 通过基于视觉描述或属性的条件输入,实现条件图像生成。
  • 仅修改特定属性即可对已有图像进行编辑,同时保持其他内容不变。
  • 结合 VAE 的重建能力与 GAN 的样本质量优势,克服两者各自的局限性。
  • 联合训练推理网络与生成模型,实现后验推理与生成过程的端到端学习。

提出的方法

  • 提出一种结合 VAE 与 InfoGAN 的混合架构,使用部分潜在变量(c)表示解耦且可解释的属性。
  • 采用编码器网络推断图像输入 x 的后验分布 q(z|x),实现与生成器和判别器的端到端训练。
  • 通过解耦潜在码 c 与生成图像 x 之间的互信息目标,促进有意义的属性解耦。
  • 通过联合损失函数联合训练模型,损失函数包含 VAE 重建损失、KL 散度、GAN 对抗损失以及特定属性的识别损失。
  • 采用多头识别头从潜在码中预测视觉属性,实现在推理阶段的属性编辑。
  • 使用 Adam 优化器,为生成器、判别器、编码器与识别器分别设置独立的学习率,并通过超参数 λ₁ 与 λ₂ 平衡重建损失与属性敏感度。

实验结果

研究问题

  • RQ1生成模型能否联合学习图像属性的解耦表示,并生成逼真、条件化的图像?
  • RQ2模型能否仅通过修改特定属性实现有意义的图像编辑,同时保持其他内容不变?
  • RQ3将 VAE 与 InfoGAN 结合,是否能提升样本质量与解耦性,优于独立的 VAE 或 GAN?
  • RQ4将推理网络与生成器、判别器联合进行端到端训练,能否获得更优的后验近似与生成性能?
  • RQ5模型的编辑能力对超参数选择(特别是 λ₁ 与 λ₂)的敏感性如何?

主要发现

  • ViGAN 生成的图像质量高、清晰度高,比 VAE 生成的样本更逼真,后者通常模糊。
  • 模型在属性驱动的图像编辑方面表现有效:在 MNIST 上修改数字标签,在 CelebA 上添加眼镜,在 LFW 上调整面部表情,同时保持空间结构稳定。
  • 在 MNIST、CelebA 与 LFW 上的重建结果表明,模型保持了高保真度,编码器能准确从输入图像中推断出潜在码。
  • 与标准 GAN 相比,ViGAN 实现了更优的属性解耦,表现为仅目标属性发生变化的可控编辑。
  • 图像编辑性能对超参数 λ₁ 与 λ₂ 极为敏感,需仔细调优以平衡重建精度与属性敏感度。
  • 定性比较显示,ViGAN 生成的样本比 VAE 或 GAN 单独生成的样本更逼真,表明两种模型优势的成功融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。