Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Image-to-Image Translation Using Domain-Specific Variational Information Bound

Hadi Kazemi, Sobhan Soleymani|arXiv (Cornell University)|Nov 29, 2018
Image Processing Techniques and Applications被引用 20
一句话总结

本文提出了一种无监督图像到图像翻译框架,通过使用特定领域的变分信息界,解耦领域不变表示与领域特定表示。通过学习共享内容与模态特异性属性的独立编码,该模型实现了无需成对数据的一对多翻译,通过采样或参考图像引导生成,实现多样化且逼真的输出。

ABSTRACT

Unsupervised image-to-image translation is a class of computer vision problems which aims at modeling conditional distribution of images in the target domain, given a set of unpaired images in the source and target domains. An image in the source domain might have multiple representations in the target domain. Therefore, ambiguity in modeling of the conditional distribution arises, specially when the images in the source and target domains come from different modalities. Current approaches mostly rely on simplifying assumptions to map both domains into a shared-latent space. Consequently, they are only able to model the domain-invariant information between the two modalities. These approaches usually fail to model domain-specific information which has no representation in the target domain. In this work, we propose an unsupervised image-to-image translation framework which maximizes a domain-specific variational information bound and learns the target domain-invariant representation of the two domain. The proposed framework makes it possible to map a single source image into multiple images in the target domain, utilizing several target domain-specific codes sampled randomly from the prior distribution, or extracted from reference images.

研究动机与目标

  • 为解决共享潜在空间模型在无监督图像到图像翻译中的局限性,即当领域差异显著时无法捕捉模态特异性信息。
  • 通过学习领域不变内容与领域特定属性的解耦表示,实现一对多翻译。
  • 通过最大化特定领域的变分信息界,提升无监督翻译中的多样性与真实性。
  • 克服循环一致性导致在翻译图像中编码领域特异性特征的问题,从而降低性能与稳定性。

提出的方法

  • 该框架使用两个编码器,从源图像中提取领域不变编码与领域特定编码。
  • 生成器利用领域不变编码与从单位正态先验采样或从参考图像中提取的目标领域特定编码,合成目标领域图像。
  • 通过最大化源领域特定编码与源图像之间的互信息,确保领域特异性特征的有意义解耦。
  • 通过最小化源领域特定编码与翻译后的目标图像之间的互信息,防止领域特异性特征被编码到目标图像中,从而减少循环一致性伪影。
  • 通过领域不变与领域特定编码的重建路径,强制实施循环一致性,确保结构与语义保真度。
  • 损失函数包含一个特定领域的变分信息界,鼓励模型学习可解释且解耦的模态特异性内容表示。

实验结果

研究问题

  • RQ1在无监督设置下,领域不变与领域特定特征的解耦表示是否能提升一对多图像翻译的性能?
  • RQ2在无成对数据的情况下,最大化特定领域的变分信息界如何提升图像翻译的多样性与真实性?
  • RQ3将领域特定与领域不变编码分离,在多大程度上减少了源图像特有属性在翻译图像中的编码?
  • RQ4所提出的方法是否在领域差异显著的跨模态翻译任务中优于CycleGAN与UNIT等循环一致性模型?
  • RQ5通过先验采样或使用参考图像,能否有效控制目标领域生成输出的多样性?

主要发现

  • 所提框架在使用领域特定编码循环一致性的条件下,实现了0.121(鞋子)与0.129(手提包)的LPIPS分数,显著优于消融版本(0.095与0.113),表明输出多样性显著提升。
  • 该模型的FID分数低于CycleGAN与UNIT,表明其与真实数据的分布对齐更好,证实了图像质量与真实感的提升。
  • 若不使用领域特定编码的循环一致性,模型会出现模式崩溃,表现为LPIPS下降,表明输出多样性降低。
  • 消融实验确认,若移除领域不变编码的循环一致性,图像质量会显著下降,因为此时不变编码可能携带领域特异性信息。
  • 在人类评估中,该框架保持了较高的欺骗率,表明生成图像在视觉上逼真,难以与真实图像区分。
  • 该模型即使在无成对数据或监督的情况下,也能在不同领域间(如边缘图到鞋子、边缘图到手提包)成功生成多样化且逼真的翻译结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。