Skip to main content
QUICK REVIEW

[論文レビュー] The Nuts and Bolts of Adopting Transformer in GANs

Rui Xu, Xiangyu Xu|arXiv (Cornell University)|Oct 25, 2021
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、Swin風ブロックによる特徴の局所性の統合、判別器における有害な残差接続の排除、およびスイーププロジェクションと条件付き正規化を用いてクラス情報を保持する、Transformerベースの GAN フレームワーク、STransGAN を提案する。本手法は、CelebA で FID 2.03、FFHQ-256 で FID 4.84 を達成し、初めての成功した条件付き Transformer GAN であることを示している。

ABSTRACT

Transformer becomes prevalent in computer vision, especially for high-level vision tasks. However, adopting Transformer in the generative adversarial network (GAN) framework is still an open yet challenging problem. In this paper, we conduct a comprehensive empirical study to investigate the properties of Transformer in GAN for high-fidelity image synthesis. Our analysis highlights and reaffirms the importance of feature locality in image generation, although the merits of the locality are well known in the classification task. Perhaps more interestingly, we find the residual connections in self-attention layers harmful for learning Transformer-based discriminators and conditional generators. We carefully examine the influence and propose effective ways to mitigate the negative impacts. Our study leads to a new alternative design of Transformers in GAN, a convolutional neural network (CNN)-free generator termed as STrans-G, which achieves competitive results in both unconditional and conditional image generations. The Transformer-based discriminator, STrans-D, also significantly reduces its gap against the CNN-based discriminators.

研究の動機と目的

  • 高精細画像生成における GAN への Transformer の適用に伴う課題に取り組むこと。過去の試みは不安定さや性能の低さにより失敗している。
  • 画像分類で成功している標準的な Transformer デザインが、GAN において、特に判別器や条件付き生成器で性能を発揮できない理由を調査すること。
  • 有害な残差接続や自己注意機構における効果の薄い条件付きインジェクションといった、アーキテクチャ上の落とし穴を特定・解決すること。
  • CNNフリーの生成器(STrans-G)と競争力のある判別器(STrans-D)を設計し、CNNベースの GAN との性能格差を是正すること。
  • 効果的な Transformer ベースの GAN を構築するための実践的で経験的妥当性を持つ設計原則(「ナットとボルト」)を確立すること。

提案手法

  • 標準的な Transformer のグローバル自己注意を置き換えるために、特徴の局所性を統合する Strans 風のローカル注意ブロックを導入する。
  • 自己注意層における標準的な残差接続を、情報フローの支配を防ぎ、判別器での学習安定性を向上させるスイーププロジェクション層に置き換える。
  • クラスラベルを生成器のメイントランクに注入する AdaNorm-T という条件付き正規化戦略を提案する。これにより、条件情報が保持される。
  • 相対的位置エンコーディングとローカルウィンドウ分割を用いることで、計算コストを低減し、高解像度設定における特徴の通信を改善する。
  • 微分可能なデータオーグメンテーションと慎重な正規化スケジューリングを含む、修正されたトレーニングプロトコルを採用して学習を安定化させる。
  • アブレーションスタディとノルム比分析を用いて設計選択を検証し、特に判別器における残差接続の否定的影響を明らかにする。

実験結果

リサーチクエスチョン

  • RQ1なぜ、画像分類で効果を発揮する標準的な Transformer アーキテクチャが、画像生成の GAN に直接適用された場合に性能を発揮しないのか?
  • RQ2特徴の局所性は、GAN に基づく画像合成における Transformer の性能にどのように影響を与えるのか?また、それを最適に実装する方法は何か?
  • RQ3なぜ自己注意層における残差接続が、Transformer ベースの判別器および条件付き生成器の学習と性能を損なうのか?
  • RQ4残差ショートカットによって条件情報が回避されないよう、効果的な戦略で条件付きクラス情報を Transformer ベースの生成器にインジェクションする方法は何か?
  • RQ5CNNフリーの生成器と競争力のある判別器を、Transformer を用いて設計し、CNN ベースの GAN を上回るか同等の性能を達成できるか?

主な発見

  • Swin レイヤーによるローカル注意は、グローバル自己注意や他の局所化された注意機構を上回り、CelebA で FID 2.03、FFHQ-256 で FID 4.84 を達成した。
  • 自己注意層における残差接続は、判別器で情報フローを支配し、サブレイヤーが無視され、性能を低下させる。これをスイーププロジェクションに置き換えることで、その影響が軽減された。
  • 生成器の残差パスに条件情報をインジェクションすると、ショートカットの支配により性能が悪化する。これをメイントランクに AdaNorm-T でインジェクションすることで、CIFAR10 でのインception スコアが 10.14 から 11.62 に向上した。
  • 提案された STrans-G 生成器は、FFHQ-256 で FID 4.84、CelebA で FID 2.03 を達成し、初めての成功した条件付き Transformer GAN を実現した。
  • STrans-D 判別器は、CNN ベースの判別器との性能格差を顕著に縮小し、安定性と品質の両面で向上を示した。
  • アブレーションスタディにより、正規化層の選択やアーキテクチャ構成(例:エンド・オブ・ブロックに AdaNorm を配置した config-c)が、モードコラプスを回避し、高品質な生成を達成するために極めて重要であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。