[論文レビュー] Autoregressive Image Generation without Vector Quantization
本稿では、ベクトル量子化を不要にする新しい拡散損失(Diffusion Loss)を提案する。この手法は、連続値をとる拡散プロセスを用いて各トークンの確率分布をモデル化することで、自己回帰的画像生成を実現する。自己回帰的に予測されたベクトルを条件とする小さなノイズ除去ネットワークを訓練することで、ImageNet 256×256 において 0.3 秒未満の推論速度で最先端の FID スコア(1.55)を達成した。これは、離散的トークン化を伴わずに連続空間に自己回帰モデルを効果的に適用できることを示している。
Conventional wisdom holds that autoregressive models for image generation are typically accompanied by vector-quantized tokens. We observe that while a discrete-valued space can facilitate representing a categorical distribution, it is not a necessity for autoregressive modeling. In this work, we propose to model the per-token probability distribution using a diffusion procedure, which allows us to apply autoregressive models in a continuous-valued space. Rather than using categorical cross-entropy loss, we define a Diffusion Loss function to model the per-token probability. This approach eliminates the need for discrete-valued tokenizers. We evaluate its effectiveness across a wide range of cases, including standard autoregressive models and generalized masked autoregressive (MAR) variants. By removing vector quantization, our image generator achieves strong results while enjoying the speed advantage of sequence modeling. We hope this work will motivate the use of autoregressive generation in other continuous-valued domains and applications. Code is available at: https://github.com/LTH14/mar.
研究の動機と目的
- 自己回帰的モデルが画像生成において離散的・ベクトル量子化された表現を必要とするという従来の信念に挑戦すること。
- 自己回帰的モデリングの利点を保ちつつ、ベクトル量子化の代替として連続値をとる代替手法を開発すること。
- 標準的自己回帰モデルとマスク付き自己回帰モデルを、連続値をとるトークンと互換性のある一般化されたフレームワークに統合すること。
- カテゴリカル交差エントロピーの代わりに拡散ベースの確率モデリング手法を採用することで、連続値空間における画像生成の質と速度を向上させること。
- 提案手法の有効性を、多様なアーキテクチャとトークン化戦略の文脈で示すこと。
提案手法
- 従来のカテゴリカル交差エントロピー損失の代わりに、各トークンの確率分布をノイズ除去拡散プロセスでモデル化する拡散損失(Diffusion Loss)を導入する。
- 自己回帰的に予測された各トークンベクトル z に対して、実際の画像トークン x の分布 p(x|z) をモデル化する小さなノイズ除去ネットワーク(例:MLP)を訓練する。
- ノイズ除去ネットワークは、バックプロパゲーションを介して自己回帰モデルと同時に訓練され、連続値をとるトークン予測のエンドツーエンド最適化が可能になる。
- 本手法は、標準的自己回帰(AR)モデルおよびマスク付き自己回帰(MAR)モデルの両方と互換性があり、柔軟な生成順序と1ステップあたりの複数トークン予測を可能にする。
- ピクセルベースおよび連続値をとるトークン化の両方に対応可能であり、分類器フリー制御(CFG)の有無に関わらず適用可能である。
- 推論では、予測された z ベクトルを条件とする逆拡散プロセスからのサンプリングが行われ、高精度な画像生成が実現される。
実験結果
リサーチクエスチョン
- RQ1各トークンの分布を拡散プロセスでモデル化することで、ベクトル量子化を不要とする自己回帰的画像生成が有効に実現可能か?
- RQ2カテゴリカル交差エントロピーを拡散ベースの損失に置き換えることで、連続値空間における画像生成の質と速度が向上するか?
- RQ3提案された拡散損失は、マスク付き自己回帰変種を含むさまざまな自己回帰アーキテクチャに一般化可能か?
- RQ4FID、IS、および推論速度の観点から、提案手法は最先端のモデルと比較してどの程度の性能を示すか?
- RQ5ランダム順序マスキングや双方向アテンションといったアーキテクチャ的選択が、連続値をとる自己回帰的生成の質と効率に与える影響は何か?
主な発見
- 提案された拡散損失は、ImageNet 256×256 において 1.55 の Fréchet Inception Distance(FID)を達成し、以前のトークンベース手法を上回り、最先端のラティス拡散モデルに近い性能を示した。
- マスク付き自己回帰モデルに拡散損失を適用することで、1 イメージあたり 0.3 秒未満の高速推論が実現され、高い推論速度を実現した。
- 拡散損失を備えた MAR バージョンは、CFG を使用しない場合 FID 2.31、使用する場合 1.78 を達成し、MaskGIT や MAGE などの以前のシステムを顕著に上回った。
- MAR フレームワークにおいて因果的アテンションを双方向アテンションに置き換えることで、FID は 13.07 から 3.43 に大幅に改善され、文脈モデリングの重要性が浮き彫りになった。
- 本手法は強力なスケーリング特性を示し、モデルサイズの増大に伴い性能が向上する傾向にあり、より大きなアーキテクチャでのさらなる向上が期待できる。
- 複雑で勾配近似に敏感なベクトル量子化トークナイザーの必要性が排除され、トレーニングの簡素化と再構成品質の向上が達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。