Skip to main content
QUICK REVIEW

[论文解读] Contrastive Learning for Unpaired Image-to-Image Translation

Taesung Park, Alexei A. Efros|arXiv (Cornell University)|Jul 30, 2020
Generative Adversarial Networks and Image Synthesis参考文献 89被引用 126
一句话总结

本文提出了一种单向、无配对的图像到图像翻译方法(CUT),通过多层、逐块对比损失(PatchNCE)在输入与输出补丁之间最大化互信息,从而在不需要循环一致性或逆映射的情况下实现高质量翻译。

ABSTRACT

In image-to-image translation, each patch in the output should reflect the content of the corresponding patch in the input, independent of domain. We propose a straightforward method for doing so -- maximizing mutual information between the two, using a framework based on contrastive learning. The method encourages two elements (corresponding patches) to map to a similar point in a learned feature space, relative to other elements (other patches) in the dataset, referred to as negatives. We explore several critical design choices for making contrastive learning effective in the image synthesis setting. Notably, we use a multilayer, patch-based approach, rather than operate on entire images. Furthermore, we draw negatives from within the input image itself, rather than from the rest of the dataset. We demonstrate that our framework enables one-sided translation in the unpaired image-to-image translation setting, while improving quality and reducing training time. In addition, our method can even be extended to the training setting where each "domain" is only a single image.

研究动机与目标

  • 在不依赖循环一致性或双射的前提下,推动跨域内容保持。
  • 提出一个对比学习目标,最大化对应的输入输出补丁之间的互信息。
  • 证明内部(同一图像内的)负样本在内容保持方面能够提供更强的信号。
  • 开发一个轻量级、单向翻译流水线(CUT),甚至可以在单图像对上运行。

提出的方法

  • 使用编码器 G_enc 和解码器 G_dec 形成两部分生成器。
  • 对多层逐块信息NCE损失(PatchNCE)进行应用,以跨多个编码器层对齐对应的输入输出补丁。
  • 从同一输入图像中采样负样本(内部负样本),以形成一个包含 N+1 类的 InfoNCE 损失的温度 tau。
  • 可选地包含一个外部负样本采样变体(外部 NCE),使用移动平均编码器,尽管内部负样本表现最佳。
  • 用一个 GAN 损失替代循环一致性,并对输入(以及可选对输出)应用 PatchNCE 损失,以强化跨域真实性与内容保持。
  • 通过省略保持恒等性的项并简化训练来提供更快的变体(FastCUT),同时保持性能。

实验结果

研究问题

  • RQ1在不依赖循环一致性的前提下,最大化对应输入与输出补丁之间的互信息是否能实现内容保持的翻译?
  • RQ2内部(同一图像内的)负样本是否比来自其他图像或记忆库的外部负样本更有效地学习跨域补丁对应?
  • RQ3多层次的逐块对比目标与传统基于循环一致性的方法在无配对翻译中的表现有何差异?
  • RQ4是否可以利用 PatchNCE 从每个领域只有一张图像时实现无配对翻译的有效训练(单图像/一次性翻译)?
  • RQ5在训练时间、内存和质量方面,CUT 与其快速变体 FastCUT 之间的权衡如何?

主要发现

  • 基于 PatchNCE 的损失在 Horse→Zebra、Cityscapes 等数据集上比多种基线(CycleGAN、MUNIT、DRIT、DistanceGAN、GcGAN)产生更高质量的翻译。
  • 来自输入图像的内部负样本优于从其他图像或记忆库中抽取的外部负样本。
  • 在多编码器层上进行补丁级对比学习,相较仅使用最后一层,可以提高内容保持和翻译质量。
  • 对输出域(Y)应用 PatchNCE 的身份正则化变体提供了训练稳定性,降低崩溃风险。
  • 与 CycleGAN 相比,CUT 实现了更快的训练和更低的内存使用,FID 和语义对应性指标具有竞争力甚至优越;FastCUT 通过进一步降低计算成本实现了类似结果。
  • 该方法可以扩展到单图像翻译任务(SinCUT),仅用每个领域的一个示例实现高分辨率的画作到照片风格转换。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。