Skip to main content
QUICK REVIEW

[论文解读] The Nuts and Bolts of Adopting Transformer in GANs

Rui Xu, Xiangyu Xu|arXiv (Cornell University)|Oct 25, 2021
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出STransGAN,一种基于Transformer的GAN框架,通过引入类似Swin的模块以增强特征局部性,消除判别器中的有害残差连接,并采用跳跃投影和条件归一化来保留类别信息,从而在高保真图像生成任务中实现最先进性能。其在CelebA数据集上达到2.03的FID,在FFHQ-256上达到4.84,首次成功实现条件式Transformer GAN。

ABSTRACT

Transformer becomes prevalent in computer vision, especially for high-level vision tasks. However, adopting Transformer in the generative adversarial network (GAN) framework is still an open yet challenging problem. In this paper, we conduct a comprehensive empirical study to investigate the properties of Transformer in GAN for high-fidelity image synthesis. Our analysis highlights and reaffirms the importance of feature locality in image generation, although the merits of the locality are well known in the classification task. Perhaps more interestingly, we find the residual connections in self-attention layers harmful for learning Transformer-based discriminators and conditional generators. We carefully examine the influence and propose effective ways to mitigate the negative impacts. Our study leads to a new alternative design of Transformers in GAN, a convolutional neural network (CNN)-free generator termed as STrans-G, which achieves competitive results in both unconditional and conditional image generations. The Transformer-based discriminator, STrans-D, also significantly reduces its gap against the CNN-based discriminators.

研究动机与目标

  • 为解决在高保真图像生成中应用Transformer于GAN时面临的不稳定性与性能不佳问题,此前的尝试均以失败告终。
  • 探究为何在图像分类任务中表现优异的标准Transformer架构,在GAN中(尤其是判别器和条件生成器中)表现欠佳。
  • 识别并解决关键架构缺陷,如自注意力层中具有破坏性的残差连接,以及自注意力机制中条件注入效率低下问题。
  • 开发一种无需CNN的生成器(STrans-G)和性能强劲的判别器(STrans-D),以弥合与基于CNN的GAN之间的性能差距。
  • 建立实用且经实证验证的设计原则——即‘核心组件’——以构建高效的基于Transformer的GAN。

提出的方法

  • 引入类似Swin的局部注意力模块,以注入特征局部性的归纳偏置,替代标准Transformer中的全局自注意力机制。
  • 将自注意力层中的标准残差连接替换为跳跃投影层,以防止信息流被主导,提升判别器的训练稳定性。
  • 提出AdaNorm-T,一种条件归一化策略,将类别标签注入生成器主干网络而非残差路径,确保条件信息得以保留。
  • 采用相对位置编码与局部窗口划分,降低计算成本,并提升高分辨率设置下的特征交互能力。
  • 采用改进的训练协议,结合可微分数据增强与精细的归一化调度策略,以稳定训练过程。
  • 通过消融研究与归一化比例分析验证设计选择,尤其强调残差连接在判别器中造成的负面影响。

实验结果

研究问题

  • RQ1为何在图像分类任务中表现优异的标准Transformer架构,在直接应用于GAN进行图像生成时表现欠佳?
  • RQ2特征局部性如何影响Transformer在基于GAN的图像生成中的性能?其最优实现方式是什么?
  • RQ3为何自注意力层中的残差连接会损害基于Transformer的判别器与条件生成器的训练过程与性能表现?
  • RQ4如何有效将条件类别信息注入基于Transformer的生成器中,以避免被残差捷径绕过?
  • RQ5能否设计一种无需CNN的生成器与性能强劲的判别器,利用Transformer实现与基于CNN的GAN相当或更优的性能?

主要发现

  • 采用局部注意力的Swin模块优于全局自注意力及其他局部化注意力机制,在CelebA上实现2.03的最低FID,在FFHQ-256上实现4.84的最低FID。
  • 自注意力层中的残差连接在判别器中主导信息流,导致子层被绕过,从而降低性能;通过替换为跳跃投影层可有效缓解此问题。
  • 将条件信息注入生成器的残差路径会导致性能下降,因捷径占据主导;通过AdaNorm-T将条件信息注入主干网络,可使CIFAR10上的Inception Score从10.14提升至11.62。
  • 所提出的STrans-G生成器在FFHQ-256上实现4.84的FID,在CelebA上实现2.03的FID,首次实现成功的条件式Transformer GAN。
  • STrans-D判别器显著缩小了与基于CNN的判别器之间的性能差距,展现出更高的训练稳定性和生成质量。
  • 消融研究证实,归一化层的选择与架构配置(如配置-c中在块末尾使用AdaNorm)对避免模式崩溃与实现高质量生成至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。