[論文レビュー] StyleSwin: Transformer-based GAN for High-resolution Image Generation
StyleSwinは、スイッチトランスフォーマーをスタイルベースジェネレータに統合し、二重アテンションと正弦波位置符号化を用いて受容 field を拡大し、空間的整合性を向上させることで、高解像度画像生成のためのトランスフォーマー基盤 GAN を提案する。1024×1024解像度の CelebA-HQ では FID スコアが 4.43、FFHQ では 5.07 を達成し、複雑な訓練戦略を用いずに StyleGAN を上回る最先端の性能を示した。
Despite the tantalizing success in a broad of vision tasks, transformers have not yet demonstrated on-par ability as ConvNets in high-resolution image generative modeling. In this paper, we seek to explore using pure transformers to build a generative adversarial network for high-resolution image synthesis. To this end, we believe that local attention is crucial to strike the balance between computational efficiency and modeling capacity. Hence, the proposed generator adopts Swin transformer in a style-based architecture. To achieve a larger receptive field, we propose double attention which simultaneously leverages the context of the local and the shifted windows, leading to improved generation quality. Moreover, we show that offering the knowledge of the absolute position that has been lost in window-based transformers greatly benefits the generation quality. The proposed StyleSwin is scalable to high resolutions, with both the coarse geometry and fine structures benefit from the strong expressivity of transformers. However, blocking artifacts occur during high-resolution synthesis because performing the local attention in a block-wise manner may break the spatial coherency. To solve this, we empirically investigate various solutions, among which we find that employing a wavelet discriminator to examine the spectral discrepancy effectively suppresses the artifacts. Extensive experiments show the superiority over prior transformer-based GANs, especially on high resolutions, e.g., 1024x1024. The StyleSwin, without complex training strategies, excels over StyleGAN on CelebA-HQ 1024, and achieves on-par performance on FFHQ-1024, proving the promise of using transformers for high-resolution image generation. The code and models will be available at https://github.com/microsoft/StyleSwin.
研究の動機と目的
- 純粋なトランスフォーマーが、高解像度画像生成において、畳み込みニューラルネットワーク(ConvNet)基盤 GAN と同等またはそれを上回る性能を達成できるかどうかを調査すること。
- 画像生成に向けた標準的なトランスフォーマーにおける高い計算コストと限られた受容 field の課題に対処すること。
- 高解像度合成におけるブロック単位の局所的アテンションによって生じるブロッキングアーティファクトを軽減すること。
- 窓ベース自己注意機構によって失われた位置のインダクティブバイアスを回復させ、生成品質を向上させること。
- 1024×1024解像度に効果的にスケーリング可能であり、高精細なディテールとグローバルな整合性を備えた画像生成を実証すること。
提案手法
- 計算効率とモデル容量のバランスを図るため、シフトされた窓自己注意を備えたスイッチトランスフォーマーブロックを採用する。
- 各層で局所的窓とシフトされた窓の両方にアテンションを適用する二重アテンションを導入し、有効な受容 field を拡大する。
- 窓ベースのアテンションで失われた絶対位置の認識を回復させるために、各スケールに正弦波位置符号化(SPE)を組み込む。
- 特に高解像度出力におけるブロッキングパターンのようなスペクトルアーティファクトを検出・抑制するため、ウェーブレットディスクライマを採用する。
- 複数スケールでの画像生成制御を可能にする、学習されたスタイルベクトルを備えたスタイルベースジェネレータアーキテクチャを採用する。
- トランスフォーマー基盤 GAN の一般化性能を向上させ、過学習を軽減するために、bCR(big-Cut-Rand)によるデータ拡張を適用する。
実験結果
リサーチクエスチョン
- RQ1純粋なトランスフォーマー基盤 GAN は、特に 1024×1024 解像度において、最先端の性能を達成できるか?
- RQ2窓ベースのトランスフォーマーにおける局所的アテンションの制限された受容 field を、過度な計算コストを伴わず効果的に拡張できるか?
- RQ3なぜブロック単位のアテンションを用いた高解像度合成でブロッキングアーティファクトが生じるのか、そしてそれらをどのように軽減できるか?
- RQ4窓ベースのトランスフォーマーにおける絶対位置情報の喪失が、画像生成品質にどの程度悪影響を及えるのか?
- RQ5スペクトル的差異を分析することで、ウェーブレットディスクライマがアーティファクトを効果的に抑制できるか?
主な発見
- CelebA-HQ 1024×1024 において、StyleSwin は FID スコア 4.43 を達成し、すべての先行するトランスフォーマー基盤 GAN を上回り、複雑な訓練戦略を用いずに StyleGAN をも凌駆した。
- FFHQ 1024×1024 では FID スコア 5.07 を達成し、StyleGAN2 に近い性能を示し、トランスフォーマー基盤 GAN の分野で新たな最先端を樹立した。
- アブレーションスタディの結果、二重アテンションにより FID が 8.40 から 7.86 に低下し、ウェーブレットディスクライマの導入でさらに 6.34 まで低下した。これは、アーティファクト抑制に有効であることを証明した。
- FFHQ-256 において、正弦波位置符号化(SPE)を導入することで FID が 6.34 から 5.76 に低下した。これは、絶対位置の指導情報の重要性を示している。
- パラメータ数が 40.86M であるにもかかわらず、1024×1024 解像度での計算量は 50.90B FLOPs にとどまり、StyleGAN2 の 74.27B FLOPs よりも低い。これは、計算コストが低いことを示している。
- 256×256 解像度の FFHQ および LSUN Church において、StyleSwin は FID スコアで最先端を記録し、StyleGAN2 や先行するトランスフォーマー基盤手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。