Skip to main content
QUICK REVIEW

[论文解读] Unpaired Multi-Domain Image Generation via Regularized Conditional GANs

Xudong Mao, Qing Li|arXiv (Cornell University)|May 7, 2018
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 4
一句话总结

本文提出正则化条件生成对抗网络(RegCGAN),一种用于无配对多领域图像生成的框架,可在无配对训练数据的情况下学习领域间的对应关系。通过在生成器的第一层引入一个正则化项以强制共享高层语义,同时在判别器的最后层引入另一个正则化项以生成不变的特征表示,该方法在边缘到照片、带属性的人脸以及领域自适应等多样化领域间的对齐图像对生成任务中实现了最先进性能。

ABSTRACT

In this paper, we study the problem of multi-domain image generation, the goal of which is to generate pairs of corresponding images from different domains. With the recent development in generative models, image generation has achieved great progress and has been applied to various computer vision tasks. However, multi-domain image generation may not achieve the desired performance due to the difficulty of learning the correspondence of different domain images, especially when the information of paired samples is not given. To tackle this problem, we propose Regularized Conditional GAN (RegCGAN) which is capable of learning to generate corresponding images in the absence of paired training data. RegCGAN is based on the conditional GAN, and we introduce two regularizers to guide the model to learn the corresponding semantics of different domains. We evaluate the proposed model on several tasks for which paired training data is not given, including the generation of edges and photos, the generation of faces with different attributes, etc. The experimental results show that our model can successfully generate corresponding images for all these tasks, while outperforms the baseline methods. We also introduce an approach of applying RegCGAN to unsupervised domain adaptation.

研究动机与目标

  • 解决在缺乏配对训练数据时多领域图像生成的挑战。
  • 克服标准条件生成对抗网络在缺乏配对样本时学习跨领域对应关系的失败。
  • 开发一种方法,在保留领域特异性特征的同时学习跨领域的共享高层语义。
  • 使模型能够通过不变特征表示应用于无监督领域自适应。
  • 提升零样本图像翻译和领域自适应任务中的泛化能力和性能。

提出的方法

  • 将生成器和判别器条件化于领域特定变量,同时共享一个公共潜在码以编码共享语义。
  • 引入生成器第一层的正则化项,通过惩罚相同潜在码但不同领域码输出之间的L2距离,强制语义一致性。
  • 在判别器最后一层添加正则化项,鼓励对应图像对的损失输出相似,引导生成器生成对齐图像。
  • 将判别器最后一层隐藏层用作特征提取器,其表示在不同领域间保持不变,从而支持迁移学习。
  • 通过损失加权和联合训练生成器与判别器,结合对抗损失和两个正则化项。
  • 通过在判别器最后一层附加分类器,将学习到的不变特征应用于无监督领域自适应。

实验结果

研究问题

  • RQ1能否通过正则化使条件生成对抗网络在无配对训练数据的情况下学习跨领域对应关系?
  • RQ2在缺乏配对样本的情况下,如何强制在不同领域间实现共享高层语义?
  • RQ3判别器最后一层能否生成可泛化至不同领域的不变表示,以支持下游任务?
  • RQ4所提出的正则化框架是否在无配对图像翻译和领域自适应任务中优于现有方法?
  • RQ5所学习的特征在仅使用极少标注数据的情况下,能在多大程度上支持无监督领域自适应?

主要发现

  • RegCGAN 成功在多样化领域(包括边缘到照片、带属性的人脸、莫奈风格图像以及季节变化)间生成对应图像对,且无需任何配对训练数据。
  • 在 MNIST 到 USPS 和 USPS 到 MNIST 的领域自适应任务中,RegCGAN 分别在采样目标集上达到 93.1% 和 89.5% 的准确率,优于 DANN、ADDA 和 CoGAN。
  • 在标准测试集上,RegCGAN 在 MNIST 到 USPS 和 USPS 到 MNIST 任务中分别达到 90.1% 和 88.8% 的准确率,展现出优于基线方法的优越泛化能力。
  • 该模型在潜在空间中实现平滑插值,表明生成图像对在内容和风格上均表现出一致的语义过渡。
  • 判别器最后一层学习到的不变特征表示支持了有效的迁移学习,验证了该方法在无监督领域自适应中的实用性。
  • 消融研究证实,两个正则化项均至关重要,因为任一正则化项的移除都会显著降低图像翻译和领域自适应任务的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。