[論文レビュー] Improving Visual Quality of Image Synthesis by A Token-based Generator with Transformers
この論文では、コンテンツとスタイルのトークンを用いて画像合成を視覚的トークン生成として定式化する、トランスフォーマーに基づく生成器TokenGANを提案する。トランスフォーマー内の自己注意およびクロス注意メカニズムを活用することで、コンテンツに適応した細分化されたスタイル制御を実現し、畳み込みを一切使用せずに、1024×1024解像度の高精細な画像を生成する。FIDスコアは最先端水準に達した。
We present a new perspective of achieving image synthesis by viewing this task as a visual token generation problem. Different from existing paradigms that directly synthesize a full image from a single input (e.g., a latent code), the new formulation enables a flexible local manipulation for different image regions, which makes it possible to learn content-aware and fine-grained style control for image synthesis. Specifically, it takes as input a sequence of latent tokens to predict the visual tokens for synthesizing an image. Under this perspective, we propose a token-based generator (i.e.,TokenGAN). Particularly, the TokenGAN inputs two semantically different visual tokens, i.e., the learned constant content tokens and the style tokens from the latent space. Given a sequence of style tokens, the TokenGAN is able to control the image synthesis by assigning the styles to the content tokens by attention mechanism with a Transformer. We conduct extensive experiments and show that the proposed TokenGAN has achieved state-of-the-art results on several widely-used image synthesis benchmarks, including FFHQ and LSUN CHURCH with different resolutions. In particular, the generator is able to synthesize high-fidelity images with 1024x1024 size, dispensing with convolutions entirely.
研究の動機と目的
- スタイルベースの生成器が抱えるスタイル制御の混合化とコンテンツに依存しない正規化の制限を解消すること。
- 局所的かつ細分化されたスタイル操作を向上させるために、画像合成を視覚的トークン生成問題として再定式化すること。
- 学習されたスタイルおよびコンテンツトークンを介して、コンテンツに適応した注意駆動型スタイル移行を可能にする生成器を設計すること。
- 畳み込み層を一切使用せずに、高解像度(例:1024×1024)での高精細な画像合成を達成すること。
提案手法
- 生成器は、2種類の学習済み潜在トークンを使用する:1枚の画像ごとに固定されるコンテンツトークンと、潜在空間から投影されるスタイルトークン。
- 視覚的トランスフォーマーがコンテンツトークンとスタイルトークンの間でクロス注意をモデル化し、各領域の条件付き画像生成を実現する。
- コンテンツトークンは空間的に配置され、画像のパッチを表す。一方、スタイルトークンは各パッチのスタイル埋め込みを符号化する。
- モデルはレイヤーナーマライゼーション(LayerNorm)を用いてスタイル正規化を行い、アブレーション実験でインスタンス正規化(InstanceNorm)やピクセル正規化(PixelNorm)を上回った。
- 生成器は判別器を伴う adversarial loss により訓練され、マッピングネットワークがノイズをスタイルトークンに変換する。
- アーキテクチャは完全にトランスフォーマーに基づいており、畳み込み層を完全に排除している。
実験結果
リサーチクエスチョン
- RQ1画像合成を効果的に視覚的トークン生成タスクとして再定式化することで、局所的スタイル制御が向上するか?
- RQ2トランスフォーマーにおけるクロス注意を用いたコンテンツに適応したスタイルモデリングは、グローバルなAdaINベースのスタイルインジェクションと比較して、画像品質をどのように向上させるか?
- RQ3高解像度画像合成において、最適なスタイルトークンおよびコンテンツトークンの数は何か?
- RQ4正規化層の選択が、トークンベースの生成器の性能にどのように影響するか?
- RQ5潜在空間が、髪型や表情といった高レベルの属性にわたる視覚的に滑らかな補間をサポートできるか?
主な発見
- FFHQ-256において、TokenGANはFID 6.81を達成し、32個のスタイルトークンを用いたStyleGAN2(FID 7.66)を上回った。
- 畳み込み層を一切使用せずに、1024×1024解像度の高精細な画像を生成でき、完全にトランスフォーマーに基づく画像生成の可能性を示した。
- スタイルトークン空間における線形補間により、メガネ、年齢、髪の長さといった属性にわたる視覚的に滑らかな遷移が得られた。
- 32個のスタイルトークンが最良の性能を示した。64個に増やすとトレーニングの不安定化と性能の低下を引き起こした。
- アブレーションスタディにおいて、LayerNormがインスタンス正規化やピクセル正規化を上回り、FID 6.81という最低スコアを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。