Skip to main content
QUICK REVIEW

[论文解读] The Spatially-Correlative Loss for Various Image Translation Tasks

Chuanxia Zheng, Tat‐Jen Cham|arXiv (Cornell University)|Apr 2, 2021
Generative Adversarial Networks and Image Synthesis参考文献 54被引用 10
一句话总结

本文提出 F/LSeSim,一种新颖的空间相关损失函数,通过在不依赖外观的情况下建模图像内的自相似性模式,实现在无配对图像到图像翻译过程中保持场景结构。该方法通过对比学习学习领域不变的空间相关性,在单模态、多模态和单图像翻译任务中均达到最先进性能,其在结构保真度和多样性方面优于循环一致性与特征匹配基线方法。

ABSTRACT

We propose a novel spatially-correlative loss that is simple, efficient and yet effective for preserving scene structure consistency while supporting large appearance changes during unpaired image-to-image (I2I) translation. Previous methods attempt this by using pixel-level cycle-consistency or feature-level matching losses, but the domain-specific nature of these losses hinder translation across large domain gaps. To address this, we exploit the spatial patterns of self-similarity as a means of defining scene structure. Our spatially-correlative loss is geared towards only capturing spatial relationships within an image rather than domain appearance. We also introduce a new self-supervised learning method to explicitly learn spatially-correlative maps for each specific translation task. We show distinct improvement over baseline models in all three modes of unpaired I2I translation: single-modal, multi-modal, and even single-image translation. This new loss can easily be integrated into existing network architectures and thus allows wide applicability.

研究动机与目标

  • 为解决现有无配对图像翻译方法在大外观变化下难以保持场景结构的局限性。
  • 通过学习领域不变的空间相关性,将场景结构与特定领域外观解耦。
  • 开发一种简单、高效且可泛化的损失函数,可轻松集成到现有网络架构中。
  • 在多模态和单图像翻译设置中提升性能,其中结构保持至关重要。
  • 通过学习任务特定的空间相关图,克服基于预训练网络的特征损失中固有的偏差。

提出的方法

  • 提出 FSeSim,一种从预训练网络特征中计算的固定自相似性图,基于图像内部的自相似性来编码空间结构。
  • 引入 LSeSim,一种使用对比学习的可学习自相似性图,可显式对齐跨域的同源结构,无论外观如何。
  • 采用对比损失以鼓励对应结构中相似的空间模式,即使外观差异显著。
  • 使用多尺度局部注意力机制,通过不同感受野计算空间相关图,提升结构细节。
  • 在现有 I2I 框架中用 F/LSeSim 替代传统内容损失(如循环一致性、感知损失),以独立评估结构。
  • 在多领域和单图像翻译设置中应用该损失,包括基于 CUT 的架构,用于高分辨率单图像翻译。

实验结果

研究问题

  • RQ1基于自相似性模式的损失函数是否能在无配对图像翻译中,在大外观变化下保持场景结构?
  • RQ2与固定特征或像素级损失相比,领域不变的空间相关表示在结构保持方面表现如何?
  • RQ3自监督对比学习方法是否能学习到在多样化翻译任务中具有泛化能力的任务特定空间相关性?
  • RQ4用 F/LSeSim 替代循环一致性或感知损失是否能提升多模态和单图像翻译的性能?
  • RQ5空间相关损失在不约束外观多样性的情况下,能在多大程度上增强结构保真度?

主要发现

  • 所提出的 F/LSeSim 损失在所有三种无配对 I2I 翻译模式中,性能优于或与 SOTA 方法(如 CycleGAN、MUNIT、CUT)相当。
  • 在多模态翻译(如冬季→夏季、夜晚→白昼)中,模型生成的输出质量更高且更具多样性,优于 MUNIT,原因在于其对外观变化无惩罚。
  • 消融研究显示,使用多层局部注意力(D 行)显著优于全局注意力或随机采样,有效减少了远距离空间相关性带来的噪声。
  • 将 L1 距离替换为余弦距离(E 行)显著提升了多样性得分,因其在不强制要求相同图值的情况下保留了相关模式。
  • 在单图像翻译中,基于 FSeSim 的模型在图像质量和风格对齐方面均优于 CUT、WCT2 和 STRORSS,尤其在高分辨率区域表现更优。
  • 完整模型采用 LSeSim(F 行)在所有指标上均取得最佳结果,证明了通过对比学习学习任务特定空间相关图的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。