Skip to main content
QUICK REVIEW

[论文解读] SingleGAN: Image-to-Image Translation by a Single-Generator Network using Multiple Generative Adversarial Learning

Xiaoming Yu, Xing Cai|arXiv (Cornell University)|Oct 11, 2018
Generative Adversarial Networks and Image Synthesis参考文献 34被引用 9
一句话总结

SingleGAN 提出了一种单生成器 GAN 框架,用于使用领域编码和多生成对抗学习实现多领域图像到图像翻译,从而在多个领域间实现高效且有效的无配对翻译。它在无配对数据集上实现了最先进性能,并在一对一、多对多和多模态翻译任务中展现出优越的定性和定量结果。

ABSTRACT

Image translation is a burgeoning field in computer vision where the goal is to learn the mapping between an input image and an output image. However, most recent methods require multiple generators for modeling different domain mappings, which are inefficient and ineffective on some multi-domain image translation tasks. In this paper, we propose a novel method, SingleGAN, to perform multi-domain image-to-image translations with a single generator. We introduce the domain code to explicitly control the different generative tasks and integrate multiple optimization goals to ensure the translation. Experimental results on several unpaired datasets show superior performance of our model in translation between two domains. Besides, we explore variants of SingleGAN for different tasks, including one-to-many domain translation, many-to-many domain translation and one-to-one domain translation with multimodality. The extended experiments show the universality and extensibility of our model.

研究动机与目标

  • 为解决现有多领域图像翻译方法因需要多个生成器而产生的效率低下和可扩展性差的问题。
  • 通过使用领域特定控制的单个生成器,实现有效且高效的无配对图像到图像翻译。
  • 探索该框架在多样化翻译任务中的泛化能力,包括一对一、多对多和多模态翻译。
  • 通过利用多个判别器实现弱监督学习,减少对成对数据或详细标注的依赖。
  • 展示统一的单生成器架构在各种图像翻译场景中的灵活性和可扩展性。

提出的方法

  • 引入领域编码作为辅助输入,以条件控制生成器实现特定的领域到领域映射。
  • 采用多个判别器,为每个目标领域强制执行对抗学习,从而实现在多个翻译任务上的同时训练。
  • 使用循环一致性损失进行无配对数据训练,以在翻译过程中保持身份和结构的一致性。
  • 通过引入属性潜在码扩展基础模型,以实现多模态生成,超越单一输出翻译的限制。
  • 通过将循环一致性损失替换为 ℓ₁ 重建损失,将框架适配于成对数据,以提升重建保真度。
  • 通过多个判别器实现弱监督学习,而无需对所有训练样本提供详细类别标注。

实验结果

研究问题

  • RQ1单个生成器是否能够在不为每对领域分别设置生成器的情况下,有效学习多个领域到领域的映射?
  • RQ2领域编码和多个判别器在无配对设置下如何提升图像翻译的性能和泛化能力?
  • RQ3所提出的框架是否能够在无成对数据或详细标注的情况下,处理如一对一和多对多图像翻译等复杂任务?
  • RQ4集成属性潜在码在多大程度上提升了图像翻译中的生成多样性?
  • RQ5该模型在多种翻译任务中,于无配对和成对数据设置下的表现如何?

主要发现

  • 与最先进方法相比,SingleGAN 在无配对图像到图像翻译任务中实现了更优性能,展现出强大的定性和定量结果。
  • 该模型在 Photo ↔ Art 数据集上成功实现了从同一输入图像生成不同艺术风格的一对多风格迁移。
  • 在 Transient-Attributes 数据集上,SingleGAN 即使在标签不完整的情况下,也能在重叠领域(如白天、夜晚、夏季、冬季)之间实现泛化。
  • 引入属性潜在码后,SingleGAN 在 edge2shoes 数据集上实现了多模态翻译,能够从同一边缘输入生成多样化的鞋类风格。
  • 在成对数据设置下,SingleGAN 通过使用 ℓ₁ 重建损失保持了强劲性能,该结果在 DUTS-TR 和 BSDS500 数据集上得到验证。
  • 该模型展现出鲁棒性和可扩展性,扩展实验证实其在多样化图像翻译任务中的普适性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。