Skip to main content
QUICK REVIEW

[論文レビュー] Styleformer: Transformer based Generative Adversarial Networks with Style Vector

Jeeseung Park, Young-Geun Kim|arXiv (Cornell University)|Jun 13, 2021
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 7
ひとこと要約

Styleformerは、スタイルド・ベクトルと独自のアテンション・スタイルインジェクションモジュールを用いたトランスフォーマー基盤の生成器をGANに提案し、長距離依存関係とグローバルオブジェクト構造をモデル化することで、単一オブジェクトおよび構成的シーン生成の両面で最先端のモデルを上回る性能を達成する。線形計算量の変種(Styleformer-L)と、トランスフォーマーの効率性とStyleGAN2の詳細精錬を組み合わせたハイブリッドアーキテクチャ(Styleformer-C)により、最先端の結果を達成する。

ABSTRACT

We propose Styleformer, which is a style-based generator for GAN architecture, but a convolution-free transformer-based generator. In our paper, we explain how a transformer can generate high-quality images, overcoming the disadvantage that convolution operations are difficult to capture global features in an image. Furthermore, we change the demodulation of StyleGAN2 and modify the existing transformer structure (e.g., residual connection, layer normalization) to create a strong style-based generator with a convolution-free structure. We also make Styleformer lighter by applying Linformer, enabling Styleformer to generate higher resolution images and result in improvements in terms of speed and memory. We experiment with the low-resolution image dataset such as CIFAR-10, as well as the high-resolution image dataset like LSUN-church. Styleformer records FID 2.82 and IS 9.94 on CIFAR-10, a benchmark dataset, which is comparable performance to the current state-of-the-art and outperforms all GAN-based generative models, including StyleGAN2-ADA with fewer parameters on the unconditional setting. We also both achieve new state-of-the-art with FID 15.17, IS 11.01, and FID 3.66, respectively on STL-10 and CelebA. We release our code at https://github.com/Jeeseung-Park/Styleformer.

研究の動機と目的

  • 複雑なシーンにおける長距離依存関係とグローバル構造をモデル化する点で、CNNベースのGANの限界を克服すること。
  • 標準的なトランスフォーマーの画像生成における2次関数的計算コストを軽減するため、線形計算量の変種を導入すること。
  • グローバル構成とローカルディテールの両方に対する制御性を高め、高精細で高解像度の画像生成を実現すること。
  • 自己注意機構がマルチオブジェクトおよび構成的シーンにおける構造的関係を効果的に捉えることの有効性を示すこと。
  • アテンションに基づくスタイリングモジュレーションを用いて、CNNベースの生成器に対するスケーラブルで効率的かつ安定的な代替手段を提供すること。

提案手法

  • 訓練の安定性と長距離モデリングの向上を図るため、マルチヘッドアテンションを強化し、レイヤー正規化を事前処理に適用したトランスフォーマーのエンコーダーを適応する。
  • 自己アテンション演算に特化したスタイリングモジュレーションおよびデモジュレーション機構として、アテンション・スタイルインジェクションモジュールを導入する。
  • 自己アテンションの計算量を2次関数的から線形に削減するため、Linformerを適用し、高解像度画像生成を可能にする(Styleformer-L)。
  • 低解像度でのStyleformerと高解像度でのStyleGAN2を統合する(Styleformer-C)ことで、トランスフォーマーによるグローバル構造の把握と、StyleGAN2による詳細なディテール精錬を活用する。
  • スタイリングミキシングとアテンションマップの可視化を用いて、グローバル構造とテクスチャ/色の分離が図られているかを分析・検証する。
  • アテンションマップに特異値分解を適用し、低ランク構造が確認されることで、視覚的合成におけるLinformerの使用が正当化されることを確認する。
Figure 1 : High-resolution compositional scenes generated by Styleformer.
Figure 1 : High-resolution compositional scenes generated by Styleformer.

実験結果

リサーチクエスチョン

  • RQ1スタイルド・ベクトルを備えたトランスフォーマー基盤の生成器は、画像生成における長距離依存関係とグローバルオブジェクト構造を効果的にモデル化できるか?
  • RQ2高解像度画像生成における自己アテンションの計算コストを、性能を損なわずに線形計算量に削減できるか?
  • RQ3トランスフォーマー基盤の生成器とCNN基盤のリファインメントヘッドを組み合わせることで、構成的シーンにおける生成品質が向上するか?
  • RQ4アテンションマップとスタイリングミキシングは、モデルがグローバル構造とローカルテクスチャ・カラーを分離できていることを示せるか?
  • RQ5単一オブジェクトおよびマルチオブジェクトデータセットにおけるFIDとISの観点から、提案手法は最先端のGANと比較してどのように優れているか?

主な発見

  • Styleformerは、CIFAR-10で非条件生成下でFID 2.82、IS 10.00を達成し、StyleGAN2-ADAを含むすべてのGANベースのモデルを上回る性能を示した。
  • Styleformer-Lは、CelebAにおいてメモリ使用量を約3倍削減し、推論速度を1.3倍向上させるとともに、FIDを3.92から3.36に改善した。
  • CLEVRデータセットでは、Styleformer-CがFID 11.67、IS 2.27を達成し、マルチオブジェクトシーン生成においてStyleGAN2(FID 16.05)を上回った。
  • Cityscapesでは、Styleformer-CがFID 5.99、IS 2.56を達成し、構成的シーン合成においてStyleGAN2(FID 8.35)を著しく上回った。
  • スタイリングミキシングの結果から、低解像度のスタイルド・ベクトルがオブジェクトのレイアウトと構造を制御しているのに対し、高解像度のスタイルド・ベクトルが色とテクスチャを制御していることが確認され、分離性が裏付けられた。
  • アテンションマップの可視化から、自己アテンションがオブジェクトの位置に注目していることが確認され、効果的な長距離相互作用とグローバル構造モデリングが実現されていることが示された。
Figure 2 : (a) Overall Architecture of Styleformer. (b) Styleformer encoder structure, which is the basic block of Styleformer.
Figure 2 : (a) Overall Architecture of Styleformer. (b) Styleformer encoder structure, which is the basic block of Styleformer.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。