Skip to main content
QUICK REVIEW

[论文解读] AlignGAN: Learning to Align Cross-Domain Images with Conditional Generative Adversarial Networks

Xudong Mao, Qing Li|arXiv (Cornell University)|Jul 5, 2017
Generative Adversarial Networks and Image Synthesis参考文献 19被引用 14
一句话总结

本文提出AlignGAN,一种基于条件生成对抗网络的模型,通过在生成器和判别器的特定层上策略性地条件化域向量,实现在无配对训练数据的情况下对齐跨域图像。该方法成功学习到解耦的域特定语义与共享语义,实现了在多样化域之间的高质量图像对齐,并通过域向量与标签向量的多条件控制实现标签传播。

ABSTRACT

Recently, several methods based on generative adversarial network (GAN) have been proposed for the task of aligning cross-domain images or learning a joint distribution of cross-domain images. One of the methods is to use conditional GAN for alignment. However, previous attempts of adopting conditional GAN do not perform as well as other methods. In this work we present an approach for improving the capability of the methods which are based on conditional GAN. We evaluate the proposed method on numerous tasks and the experimental results show that it is able to align the cross-domain images successfully in absence of paired samples. Furthermore, we also propose another model which conditions on multiple information such as domain information and label information. Conditioning on domain information and label information, we are able to conduct label propagation from the source domain to the target domain. A 2-step alternating training algorithm is proposed to learn this model.

研究动机与目标

  • 解决缺乏配对训练样本时跨域图像对齐的挑战,该限制制约了先前方法的性能。
  • 通过优化域向量在模型中的条件化位置,提升条件生成对抗网络在跨域图像对齐任务中的表现。
  • 通过联合条件化域向量与标签向量,实现从源域到目标域的有效标签传播。
  • 为原本难以训练的多条件模型开发一种稳定的训练策略。
  • 通过扩展域向量维度,将方法推广至两个以上域,实现多域泛化。

提出的方法

  • 在判别器的图像输入层条件化域向量,以增强域信号,同时避免在生成器的噪声输入层进行条件化,以保留共享语义。
  • 采用两步交替训练算法,联合优化包含域向量与标签向量的多条件模型。
  • 应用条件生成对抗网络损失,并结合域向量,引导生成器生成与域对齐的图像,同时保持内容语义的一致性。
  • 利用域特定特征与共享特征的解耦,通过标签向量实现对生成图像类别的精确控制。
  • 在大多数任务中使用最小二乘生成对抗网络损失(LSGAN)以稳定训练并提升图像质量,而在如数字与负向数字等特定任务中切换至标准生成对抗网络损失。
  • 通过增加域向量的维度,将模型扩展至三个或更多域。

实验结果

研究问题

  • RQ1当缺乏配对数据时,条件生成对抗网络能否被有效适配于跨域图像对齐任务?
  • RQ2网络架构中域向量条件化的放置位置如何影响对齐性能?
  • RQ3对域信息与标签信息进行联合条件化,能否实现从源域到目标域的有效标签传播?
  • RQ4何种训练策略能够实现对原本难以训练的多条件生成对抗网络的稳定优化?
  • RQ5AlignGAN在多于两个域以及多样化图像翻译任务中的泛化能力如何?

主要发现

  • AlignGAN在无配对样本的情况下,成功实现了在多个任务中的跨域图像对齐,包括数字与负向数字、金发与黑发、椅子与汽车等。
  • 模型生成的不同域图像之间表现出高度相关性,例如在椅子与汽车图像生成中能匹配旋转角度。
  • 通过同时条件化域向量与标签向量,实现了有效的标签传播,使用户能够控制目标域中生成图像的类别标签。
  • 两步交替训练算法实现了多条件模型的稳定训练,克服了直接联合训练中的收敛问题。
  • LSGAN损失在大多数任务中提升了图像质量与训练稳定性,但标准生成对抗网络在如数字与负向数字等特定任务中表现更优。
  • 通过扩展域向量维度,该方法成功推广至三个或更多域,如模型架构所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。