Skip to main content
QUICK REVIEW

[论文解读] ITTR: Unpaired Image-to-Image Translation with Transformers

Wanfeng Zheng, Qiang Li|arXiv (Cornell University)|Mar 30, 2022
Multimodal Machine Learning Applications被引用 12
一句话总结

本文提出 ITTR,一种基于视觉变换器的无配对图像到图像翻译架构,结合了混合感知模块(HPB)以捕捉局部与全局上下文,并采用双分支剪枝自注意力(DPSA)以降低计算成本。ITTR 在六个基准测试中达到最先进性能,在 FID 和 DRN-Score 上均优于先前方法,同时保持高效。

ABSTRACT

Unpaired image-to-image translation is to translate an image from a source domain to a target domain without paired training data. By utilizing CNN in extracting local semantics, various techniques have been developed to improve the translation performance. However, CNN-based generators lack the ability to capture long-range dependency to well exploit global semantics. Recently, Vision Transformers have been widely investigated for recognition tasks. Though appealing, it is inappropriate to simply transfer a recognition-based vision transformer to image-to-image translation due to the generation difficulty and the computation limitation. In this paper, we propose an effective and efficient architecture for unpaired Image-to-Image Translation with Transformers (ITTR). It has two main designs: 1) hybrid perception block (HPB) for token mixing from different receptive fields to utilize global semantics; 2) dual pruned self-attention (DPSA) to sharply reduce the computational complexity. Our ITTR outperforms the state-of-the-arts for unpaired image-to-image translation on six benchmark datasets.

研究动机与目标

  • 解决基于 CNN 的生成器在无配对图像到图像翻译中捕捉长距离依赖关系能力有限的问题。
  • 克服基于识别的视觉变换器在图像翻译任务中计算成本高且生成不稳定的缺陷。
  • 设计一种高效且有效的基于变换器的生成器,平衡全局上下文建模与计算效率。
  • 在多样化的无配对图像翻译基准上验证所提架构,获得强而有力的定量与定性结果。

提出的方法

  • 混合感知模块(HPB)整合了深度可分离卷积分支用于局部特征提取,以及自注意力分支用于全局上下文建模,实现多感受野特征融合。
  • 双剪枝自注意力(DPSA)通过在计算注意力图之前,沿行和列方向评估并剪枝低贡献令牌,从而降低自注意力的复杂度。
  • 在 DPSA 中对查询和键矩阵应用逐令牌 L2 归一化,以稳定训练过程并防止崩溃,确保可靠的注意力学习。
  • 生成器架构采用端到端训练,结合循环一致性损失与身份损失,利用来自源域和目标域的无配对数据。
  • DPSA 通过可学习的贡献分数实现稀疏令牌选择,降低 FLOPs 同时保持性能。
  • 模型使用标准 GAN 目标进行优化,并在六个标准无配对翻译基准上进行评估。

实验结果

研究问题

  • RQ1基于视觉变换器的生成器是否能通过捕捉长距离依赖关系,在无配对图像到图像翻译中超越基于 CNN 的生成器?
  • RQ2如何在不牺牲翻译质量的前提下,降低视觉变换器中自注意力机制的高计算成本?
  • RQ3将局部感知(CNN)与全局注意力(Transformer)结合在一个模块中,对图像翻译有何影响?
  • RQ4在自注意力中进行令牌剪枝是否能保持甚至增强语义一致性和图像质量?
  • RQ5在 FID、DRN-Score 和推理效率方面,所提架构与最先进方法相比表现如何?

主要发现

  • ITTR 在六个无配对图像到图像翻译基准上达到最先进性能,在 FID 和 DRN-Score 上均优于先前方法。
  • 在 Horse→Zebra 和 Cityscapes 数据集上,ITTR 分别取得 45.1 和 33.6 的 FID 分数,优于 CUT 和 LSeSim。
  • 消融实验表明,若移除 HPB 中的局部感知分支,性能会下降(FID 从 45.7 降至 48.6),表明其在减少域差距方面具有关键作用。
  • DPSA 显著降低了计算复杂度:ITTR 的生成器仅使用 45.8 G MACs,低于 CUT 和 LSeSim,同时取得更优的 FID 分数。
  • 若不使用查询和键矩阵的逐令牌 L2 归一化,模型会发生崩溃,证明其在训练稳定性中的关键作用。
  • 在 DPSA 中使用 8×8 的稀疏令牌时性能最佳;更大的令牌数量(如 16×16)会因剪枝效果减弱和 Softmax 平滑而降低性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。