Skip to main content
QUICK REVIEW

[论文解读] Dual Contrastive Learning for Unsupervised Image-to-Image Translation

Junlin Han, Mehrdad Shoeiby|arXiv (Cornell University)|Apr 15, 2021
Cancer-related molecular mechanisms research参考文献 38被引用 15
一句话总结

该论文提出 DCLGAN,一种用于无监督图像到图像翻译的双对比学习框架,通过为源域和目标域分别使用独立的编码器和投影头,提升特征对齐与稳定性。通过最大化补丁级特征之间的互信息,同时避免循环一致性约束,DCLGAN 实现了最先进性能,并显著减少了模式崩溃,尤其在照片到标签翻译等任务中,使 Cityscapes 等基准测试中的表现更接近有监督方法。

ABSTRACT

Unsupervised image-to-image translation tasks aim to find a mapping between a source domain X and a target domain Y from unpaired training data. Contrastive learning for Unpaired image-to-image Translation (CUT) yields state-of-the-art results in modeling unsupervised image-to-image translation by maximizing mutual information between input and output patches using only one encoder for both domains. In this paper, we propose a novel method based on contrastive learning and a dual learning setting (exploiting two encoders) to infer an efficient mapping between unpaired data. Additionally, while CUT suffers from mode collapse, a variant of our method efficiently addresses this issue. We further demonstrate the advantage of our approach through extensive ablation studies demonstrating superior performance comparing to recent approaches in multiple challenging image translation tasks. Lastly, we demonstrate that the gap between unsupervised methods and supervised methods can be efficiently closed.

研究动机与目标

  • 为解决现有无监督图像到图像翻译方法的局限性,特别是模式崩溃和几何感知翻译中的不稳定性。
  • 通过为源域和目标域分别使用独立的编码器和投影头,改进无配对图像翻译中的对比学习。
  • 消除对循环一致性损失的依赖,该损失会限制几何灵活性,并在结构无关任务中降低性能。
  • 提出一种变体 SimDCL,通过修改对比目标以鼓励生成输出的多样性,有效缓解多模态翻译任务(如照片到标签翻译)中的模式崩溃。
  • 通过改进对比表示学习,缩小无监督与有监督图像翻译方法之间的性能差距。

提出的方法

  • DCLGAN 使用两个独立的编码器和投影头——一个用于源域,一个用于目标域——以学习领域特定的嵌入并改善特征对齐。
  • 该方法采用基于补丁的多层 PatchNCE 损失,以最大化输入图像和输出图像中对应补丁之间的互信息,并为每个领域使用独立的投影。
  • 它采用双学习设置,同时处理两个领域,从而增强训练稳定性,并促进跨领域的更好特征学习。
  • 该方法在 PatchNCE 损失中省略 RGB 像素特征,因为它们代表最小的补丁尺寸,会引入误导性信号,从而改善收敛性。
  • 通过将同一领域的特征堆栈连接以引入外部负样本,探索了外部负样本的使用,但因特征融合导致视觉质量略有下降。
  • 提出一种变体 SimDCL,通过修改对比目标以鼓励生成输出的多样性,以缓解模式崩溃。

实验结果

研究问题

  • RQ1具有独立编码器的双对比学习框架是否能在无配对图像到图像翻译中超越单编码器方法(如 CUT)?
  • RQ2在需要几何变化的任务(如猫到狗或狗到猫翻译)中,移除循环一致性损失是否能提升性能?
  • RQ3为源域和目标域分别使用独立嵌入是否能缓解多模态翻译任务(如照片到标签翻译)中的模式崩溃?
  • RQ4从 PatchNCE 损失中省略 RGB 像素对对比学习在图像翻译中的收敛性和性能有何影响?
  • RQ5对比学习在多大程度上能缩小无监督与有监督图像翻译方法之间的性能差距?

主要发现

  • DCLGAN 在多个图像翻译基准测试中达到最先进性能,包括 Horse→Zebra、Zebra→Horse 和 Cityscapes,优于 CUT 和 CycleGAN。
  • 从 PatchNCE 损失中省略 RGB 像素可改善收敛性和性能,因为如 CUT 所示包含它们会导致所有任务中性能下降。
  • 使用单个编码器和共享投影头(如 CUT 所示)导致性能更差,证实独立嵌入对于捕捉领域特异性可变性至关重要。
  • 将循环一致性损失添加到 DCLGAN 会降低性能,尤其在几何敏感任务中,Cat→Dog 和 Dog→Cat 的 FID 分数分别为 71.1 和 35.5,劣于 DCLGAN 的原始结果。
  • 双学习设置显著稳定了训练并改善了特征学习,因为若移除该设置会导致性能下降。
  • SimDCL 有效缓解了模式崩溃,在照片到标签翻译中能生成多样且逼真的输出,而 CUT 和 DCLGAN 则产生几乎相同的输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。