Skip to main content
QUICK REVIEW

[论文解读] Attention-Guided Generative Adversarial Networks for Unsupervised Image-to-Image Translation

Hao Tang, Dan Xu|arXiv (Cornell University)|Mar 28, 2019
Generative Adversarial Networks and Image Synthesis参考文献 49被引用 16
一句话总结

本文提出了一种用于无监督图像到图像翻译的注意力引导生成对抗网络(AGGAN),引入了一种内置注意力机制的新型生成器,用于检测具有区分性的语义部件,并生成注意力/内容掩码,从而实现高质量、无伪影的图像翻译。该方法在无需成对数据或外部模型的情况下,实现了最先进的性能,生成的图像更加清晰、逼真,语义一致性与细节保留性更优,尤其在面部表情迁移任务中表现突出。

ABSTRACT

The state-of-the-art approaches in Generative Adversarial Networks (GANs) are able to learn a mapping function from one image domain to another with unpaired image data. However, these methods often produce artifacts and can only be able to convert low-level information, but fail to transfer high-level semantic part of images. The reason is mainly that generators do not have the ability to detect the most discriminative semantic part of images, which thus makes the generated images with low-quality. To handle the limitation, in this paper we propose a novel Attention-Guided Generative Adversarial Network (AGGAN), which can detect the most discriminative semantic object and minimize changes of unwanted part for semantic manipulation problems without using extra data and models. The attention-guided generators in AGGAN are able to produce attention masks via a built-in attention mechanism, and then fuse the input image with the attention mask to obtain a target image with high-quality. Moreover, we propose a novel attention-guided discriminator which only considers attended regions. The proposed AGGAN is trained by an end-to-end fashion with an adversarial loss, cycle-consistency loss, pixel loss and attention loss. Both qualitative and quantitative results demonstrate that our approach is effective to generate sharper and more accurate images than existing models. The code is available at https://github.com/Ha0Tang/AttentionGAN.

研究动机与目标

  • 解决现有基于GAN的图像到图像翻译模型在翻译过程中无法保留高层语义结构并产生伪影的局限性。
  • 实现在无需成对训练数据或额外对象掩码预测模型情况下的无监督图像翻译。
  • 开发一种能够自动检测并聚焦于具有区分性的语义部件(如眼睛、嘴巴)的同时保留无关背景和非相关区域的生成器。
  • 提出一种注意力引导的判别器,仅评估被关注的区域,从而提升训练稳定性与定位准确性。
  • 通过对抗损失、循环一致性损失、像素级损失与注意力损失的端到端联合训练,提升图像质量与语义保真度。

提出的方法

  • 所提出的AGGAN采用两个带有内置注意力模块的生成器,分别输出注意力掩码(突出具有区分性的部件)与内容掩码(保留非区分性区域)。
  • 生成器将输入图像与注意力掩码及内容掩码融合,生成高质量的翻译图像,同时最小化对非相关区域的改变。
  • 提出一种新颖的注意力引导判别器,仅评估被关注的区域,从而提升定位精度并减少对抗反馈中的噪声。
  • 通过对抗损失、循环一致性损失、像素级损失与注意力损失的联合优化,实现端到端训练,确保输出的保真度与一致性。
  • 将注意力机制直接集成到生成器架构中,实现无需外部监督的显著特征自监督发现。
  • 该框架可兼容现有GAN架构,并可轻松适配其他图像翻译任务。

实验结果

研究问题

  • RQ1生成器中内置的注意力机制是否能提升无监督图像到图像翻译过程中对具有区分性语义部件的定位能力?
  • RQ2仅聚焦于被关注区域的注意力引导判别器是否能带来更优的图像质量并减少伪影?
  • RQ3所提出的AGGAN是否能在无需成对训练数据的情况下,生成更清晰、更逼真、面部细节更清楚且表情正确的图像?
  • RQ4注意力掩码的生成与不同数据集上的图像质量及语义一致性之间是否存在相关性?
  • RQ5所提出的损失函数(注意力损失、像素损失、循环一致性损失)在整体性能提升中的贡献程度如何?

主要发现

  • 与最先进模型(包括Pix2pix和ContrastGAN等全监督方法)相比,AGGAN在AR Face、Bu3dfe与CelebA数据集上均取得了最佳定量性能。
  • 在AR Face数据集上,消融实验表明,移除任一组件(尤其是注意力引导生成器或注意力损失)均会显著降低图像质量,证实了其关键作用。
  • 可视化结果表明,注意力掩码始终聚焦于眼睛、嘴巴等关键面部区域,这些区域对表情迁移最为相关,而头发、面颊与背景则作为内容掩码被有效保留。
  • 注意力掩码在训练过程中持续演化,与图像质量的提升逐步对齐,表明模型有效学习了具有区分性的特征。
  • 与CycleGAN、DualGAN和DiscoGAN相比,AGGAN在生成逼真面部表情、更清晰细节与更少伪影方面表现更优。
  • 尽管每个领域仅使用单一生成器与判别器,AGGAN的性能仍可与依赖额外对象掩码标注的ContrastGAN等模型比肩或超越。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。