Skip to main content
QUICK REVIEW

[论文解读] Cross-Domain Cascaded Deep Feature Translation

Oren Katzir, Dani Lischinski|arXiv (Cornell University)|Jun 4, 2019
Generative Adversarial Networks and Image Synthesis参考文献 35被引用 11
一句话总结

本文提出了一种跨域图像到图像翻译方法,通过级联式、从深层到浅层的方式翻译预训练VGG-19网络的深层特征,实现在保持语义一致性的同时实现显著的几何形状变形。通过利用预训练的语义特征以及在特征图上的对抗性训练,该方法在具有挑战性的形状变形任务(如斑马到长颈鹿、大象到斑马)上实现了最先进性能,FID得分优于CycleGAN、MUNIT和DRIT。

ABSTRACT

In recent years we have witnessed tremendous progress in unpaired image-to-image translation methods, propelled by the emergence of DNNs and adversarial training strategies. However, most existing methods focus on transfer of style and appearance, rather than on shape translation. The latter task is challenging, due to its intricate non-local nature, which calls for additional supervision. We mitigate this by descending the deep layers of a pre-trained network, where the deep features contain more semantics, and applying the translation from and between these deep features. Specifically, we leverage VGG, which is a classification network, pre-trained with large-scale semantic supervision. Our translation is performed in a cascaded, deep-to-shallow, fashion, along the deep feature hierarchy: we first translate between the deepest layers that encode the higher-level semantic content of the image, proceeding to translate the shallower layers, conditioned on the deeper ones. We show that our method is able to translate between different domains, which exhibit significantly different shapes. We evaluate our method both qualitatively and quantitatively and compare it to state-of-the-art image-to-image translation methods. Our code and trained models will be made available.

研究动机与目标

  • 解决在形状和外观差异极大的域之间进行未配对图像到图像翻译的挑战。
  • 在无需实例级监督或复杂架构修改的情况下,实现在图像翻译中的显著几何形变。
  • 利用分类网络(VGG-19)的预训练深层特征来编码高层语义,以实现更一致的形状翻译。
  • 开发一种级联式、从深层到浅层的翻译流程,通过利用深层结果来条件化浅层翻译,实现分层优化。
  • 实现语义一致的翻译,保持物体姿态、实例数量以及部分遮挡关系。

提出的方法

  • 该方法从预训练的VGG-19网络在多个层级提取源域和目标域图像的深层特征图。
  • 以级联式、粗到细的方式,在对应深层特征层之间执行对抗性翻译,从最深层(最具语义性)开始。
  • 每个翻译网络通过对抗性训练生成目标域特征,条件于前一层的翻译输出。
  • 通过使用预训练的VGG-19特征反演网络(遵循Dosovitskiy和Brox, 2016)将翻译后的深层特征反演重建为最终图像。
  • 该方法采用多阶段训练策略,按顺序训练每一层的翻译器,其中深层网络为浅层网络提供指导。
  • 应用特征反演以从翻译后的深层特征可视化生成图像,支持定性和定量评估。

实验结果

研究问题

  • RQ1来自预训练分类网络的深层特征是否能够实现有效跨域图像翻译,并支持大规模几何形变?
  • RQ2在深层特征上采用级联式、从深层到浅层的翻译策略,是否能在形状翻译过程中保持语义一致性(如物体姿态和实例数量)?
  • RQ3在形状变形任务中,与端到端图像到图像翻译相比,特征级翻译在FID得分和视觉质量方面表现如何?
  • RQ4VGG-19的预训练特征在多大程度上捕捉了语义上有意义的表征,从而在无需额外监督的情况下支持跨域翻译?
  • RQ5该方法是否能泛化到具有极端形状差异的未配对域对(如斑马到长颈鹿或大象到斑马)?

主要发现

  • 该方法在六项跨域翻译任务中的五项上取得了最佳FID得分,猫↔狗任务的得分为67.58 / 46.02,斑马↔长颈鹿任务的得分为67.41 / 39.38。
  • 在斑马↔大象翻译任务中,该方法的FID得分为68.45 / 47.86,显著优于CycleGAN(86.55 / 68.44)和MUNIT(109.56 / 80.1)。
  • 定性结果表明,该方法成功实现了剧烈的几何形变(如拉长大象的脖子或缩小斑马的头部),同时保持了物体姿态和构图的一致性。
  • 对最终全连接层特征的t-SNE可视化显示,翻译后的特征最接近目标域分布,证实了语义一致性。
  • 该方法在具有高形状差异的挑战性域对上泛化良好,即使在部分遮挡或裁剪情况下仍能保持物体级语义。
  • 尽管表现优异,该方法在某些情况下仍难以保持背景内容或小物体部分,原因在于VGG-19的非可逆性以及特征级误差放大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。