Skip to main content
QUICK REVIEW

[论文解读] O-GAN: Extremely Concise Approach for Auto-Encoding Generative Adversarial Networks

Jianlin Su|arXiv (Cornell University)|Mar 5, 2019
Generative Adversarial Networks and Image Synthesis参考文献 21被引用 16
一句话总结

O-GAN 提出了一种极简、无需超参数的改进方法,通过基于相关性的损失函数,将标准 GAN 的判别器转化为强大且可训练的编码器。通过正交分解判别器并引入噪声向量与其编码重建结果之间的皮尔逊相关性损失,O-GAN 在不增加模型复杂度或训练成本的前提下,实现了高质量的图像重建与解耦表征。

ABSTRACT

In this paper, we propose Orthogonal Generative Adversarial Networks (O-GANs). We decompose the network of discriminator orthogonally and add an extra loss into the objective of common GANs, which can enforce discriminator become an effective encoder. The same extra loss can be embedded into any kind of GANs and there is almost no increase in computation. Furthermore, we discuss the principle of our method, which is relative to the fully-exploiting of the remaining degrees of freedom of discriminator. As we know, our solution is the simplest approach to train a generative adversarial network with auto-encoding ability.

研究动机与目标

  • 解决标准 GAN 中判别器容量被低估的问题,该问题在训练过程中常退化为平凡函数。
  • 在不增加额外参数或计算开销的前提下,使标准 GAN 学习到有意义且可逆的编码器。
  • 提供一种简单、即插即用的解决方案,增强 GAN 的自编码能力,同时保持生成质量。
  • 探索判别器架构中的自由度,并加以利用以强制实现有意义的特征学习。
  • 仅通过一个额外的损失项,实现潜在空间中解耦且可线性插值的表征。

提出的方法

  • 将判别器输出分解为 $ D(x) = T(E(x)) $,其中 $ E $ 为共享编码器,$ T $ 为标量头,使 $ E $ 成为特征提取器。
  • 引入一种新颖的辅助损失 $ -\lambda_2 \rho(z, E(G(z))) $,其中 $ \rho $ 为噪声向量 $ z $ 与编码生成图像 $ E(G(z)) $ 之间的皮尔逊相关性,以鼓励实现解耦且可重建的表征。
  • 使用 $ \text{avg}(E(x)) $ 作为判别器得分,替代标准的 $ D(x) $,以简化训练并稳定优化过程。
  • 应用微分正则化项 $ R_{x,z} $ 以提升训练稳定性并防止模式崩溃。
  • 采用单步交替优化方案,联合训练编码器 $ E $ 与生成器 $ G $,每轮生成器更新对应一次编码器更新。
  • 仅需添加相关性损失并重新定义判别器输出,即可将该方法嵌入任意 GAN 框架,修改极简。

实验结果

研究问题

  • RQ1是否可以在不增加参数或计算成本的前提下,将标准 GAN 中的判别器重新用作有意义的编码器?
  • RQ2如何利用判别器架构中剩余的自由度来强制实现结构化、解耦的表征?
  • RQ3在潜在噪声与重建特征之间使用简单的基于相关性的损失,是否能提升 GAN 中的表征质量?
  • RQ4该模型是否能在保持高质量图像生成的同时,实现准确的重建与潜在空间中的平滑插值?
  • RQ5是否仅通过最小的、可微的修改,就在 GAN 框架中实现类似 VAE 的推理能力?

主要发现

  • 通过 O-GAN 学习到的编码器实现了高质量的图像重建,如在 CelebA-HQ、FFHQ、LSUN-church 和 LSUN-bedroom 数据集上的定性结果所示,输入图像与重建图像几乎完全一致。
  • 潜在空间中的线性插值在真实图像之间产生平滑且语义连贯的过渡,表明实现了解耦且连续的表征。
  • 该方法保持了原始 GAN 的生成质量,所有评估数据集中的高质量随机采样结果均证明了这一点。
  • 该方法仅通过一个相关性损失项实现上述效果,无需额外参数,计算开销可忽略不计。
  • 编码器在仅使用 RMSProp 且固定学习率为 $ 10^{-4} $、$ \beta = 0.99 $ 的情况下,无需梯度惩罚或额外归一化即可有效训练。
  • 训练在 30k–50k 次迭代内收敛(在 GTX 1060 上约需 12 小时),证明了其实际可行性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。