Skip to main content
QUICK REVIEW

[论文解读] Semantics-Aware Image to Image Translation and Domain Transfer

Pravakar Roy, Nicolai Häni|arXiv (Cornell University)|Apr 3, 2019
Generative Adversarial Networks and Image Synthesis参考文献 46被引用 8
一句话总结

本文提出SemGAN,一种语义感知的图像到图像翻译框架,通过共享编码器-解码器架构,联合翻译图像及其语义标签,在不同域之间实现跨域一致性与物体形态变换损失。通过在翻译过程中保持语义结构,SemGAN在无监督域自适应任务中达到最先进性能,在GTA5到Cityscapes的图像翻译中,mIoU提升5.4%,像素准确率提升13.5%。

ABSTRACT

Image to image translation is the problem of transferring an image from a source domain to a different (but related) target domain. We present a new unsupervised image to image translation technique that leverages the underlying semantic information for object transfiguration and domain transfer tasks. Specifically, we present a generative adversarial learning approach that jointly translates images and labels from a source domain to a target domain. Our main technical contribution is an encoder-decoder based network architecture that jointly encodes the image and its underlying semantics and translates both individually to the target domain. Additionally, we propose object transfiguration and cross-domain semantic consistency losses that preserve semantic labels. Through extensive experimental evaluation, we demonstrate the effectiveness of our approach as compared to the state-of-the-art methods on unsupervised image-to-image translation, domain adaptation, and object transfiguration.

研究动机与目标

  • 解决语义分割任务中合成图像与真实世界图像之间的域差距问题。
  • 在存在几何与风格变化的情况下,保持无监督图像到图像翻译过程中的语义一致性。
  • 通过联合翻译图像及其对应语义标签,提升域自适应性能。
  • 克服现有基于GAN的方法在翻译过程中无法保持标签一致性的局限。
  • 通过强制跨域语义一致性,实现有效的物体形态变换。

提出的方法

  • 一个共享编码器网络将输入图像及其语义标签图联合编码为共享潜在表征。
  • 两个独立的解码器网络从共享潜在码中重建翻译后的图像和对应的语义标签图。
  • 通过循环一致性损失进行模型训练,以确保重建保真度与域迁移能力。
  • 跨域语义一致性损失确保翻译后的图像与预测标签在不同域之间保持语义对齐。
  • 物体形态变换损失在域迁移过程中强制个体对象的结构一致性。
  • 整体目标函数结合对抗损失、重建损失、域一致性损失与形态变换损失,实现联合优化。

实验结果

研究问题

  • RQ1联合图像与语义标签翻译是否能提升语义分割任务中的域自适应性能?
  • RQ2所提出的跨域语义一致性损失在翻译过程中对保留物体级语义的效用如何?
  • RQ3引入物体形态变换损失是否能提升模型在未见域偏移下的泛化能力?
  • RQ4SemGAN在分割准确率与mIoU指标上相较于最先进无监督图像到图像翻译方法表现如何?
  • RQ5当从合成图像翻译到真实世界街景时,模型在多大程度上保持了语义保真度?

主要发现

  • SemGAN在GTA5到Cityscapes的域自适应基准上达到77.39%的mIoU,优于次佳方法5.4个百分点。
  • 与次佳方法相比,模型将像素准确率提升13.5个百分点,达到21.71%,而后者为8.21%。
  • 移除跨域语义一致性损失(L_dom)后,mIoU下降8个百分点,表明其在性能中的关键作用。
  • 消融实验表明,仅使用跨域一致性损失即可使mIoU提升8%,像素准确率提升23%。
  • 定性结果表明,与CycleGAN、UNIT和SG-GAN相比,SemGAN生成的图像在保留物体形状与语义结构方面表现更优。
  • 模型在真实图像到真实图像的翻译任务中也表现出良好泛化能力,即使在无配对数据情况下仍保持强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。