Skip to main content
QUICK REVIEW

[論文レビュー] Unleashing Transformers: Parallel Token Prediction with Discrete Absorbing Diffusion for Fast High-Resolution Image Generation from Vector-Quantized Codes

Sam Bond-Taylor, Peter Hessey|arXiv (Cornell University)|Nov 24, 2021
Generative Adversarial Networks and Image Synthesis参考文献 74被引用数 6
ひとこと要約

本論文では、高速で高解像度の画像生成を実現するため、Transformerバックボーンを用いた並列的で非自己回帰的な拡散モデルを提案する。VQ(Vector-Quantized)トークンを予測するために、VQトークンをランダムにマスクし、1つのTransformerでそれらを再構築する学習を行うことで、訓練データを上回る解像度でも高速かつグローバルに一貫性のある画像合成が可能となる。FID、密度、カバレッジスコアの面で最先端の性能を達成するとともに、計算コストを削減する。

ABSTRACT

Whilst diffusion probabilistic models can generate high quality image content, key limitations remain in terms of both generating high-resolution imagery and their associated high computational requirements. Recent Vector-Quantized image models have overcome this limitation of image resolution but are prohibitively slow and unidirectional as they generate tokens via element-wise autoregressive sampling from the prior. By contrast, in this paper we propose a novel discrete diffusion probabilistic model prior which enables parallel prediction of Vector-Quantized tokens by using an unconstrained Transformer architecture as the backbone. During training, tokens are randomly masked in an order-agnostic manner and the Transformer learns to predict the original tokens. This parallelism of Vector-Quantized token prediction in turn facilitates unconditional generation of globally consistent high-resolution and diverse imagery at a fraction of the computational expense. In this manner, we can generate image resolutions exceeding that of the original training set samples whilst additionally provisioning per-image likelihood estimates (in a departure from generative adversarial approaches). Our approach achieves state-of-the-art results in terms of Density (LSUN Bedroom: 1.51; LSUN Churches: 1.12; FFHQ: 1.20) and Coverage (LSUN Bedroom: 0.83; LSUN Churches: 0.73; FFHQ: 0.80), and performs competitively on FID (LSUN Bedroom: 3.64; LSUN Churches: 4.07; FFHQ: 6.11) whilst offering advantages in terms of both computation and reduced training set requirements.

研究の動機と目的

  • 高解像度画像生成における自己回帰的VQ-VAEモデルの遅い逐次的サンプリングを克服すること。
  • 順序に依存しない制約のないTransformerアーキテクチャを用いて、VQトークンの並列予測を可能にすること。
  • コンテキストウィンドウの集約を用いて、訓練データの解像度を上回るサイズでグローバルに一貫性のある画像を生成すること。
  • 尤度ベースの指標(密度、カバレッジ)とFIDにおいて最先端の性能を達成するとともに、計算およびデータ要件を削減すること。
  • GANベースの手法とは異なり、画像ごとの尤度推定を提供することにより、より良い評価や条件付き生成の可能性を高めること。

提案手法

  • 訓練中にVQトークンを段階的にマスクする離散吸収拡散プロセスを用い、非自己回帰的かつ順序に依存しない方法でマスクを実現する。
  • 1つの非自己回帰的Transformerを、マスクされたバージョンから元のVQトークンを再構築するように学習させ、並列予測を可能にする。
  • 自己注意機構を活用してグローバルな文脈を捉えることで、エンドツーエンドに全系列のVQトークンを並列で予測するようにモデルを訓練する。
  • 推論時には完全にマスクされた状態からノイズ除去を行い、複数のコンテキストウィンドウを統合することで高解像度の画像を生成する。
  • アンコンdition付きおよび条件付き生成をサポートし、局所的な画像編集も、特定の部分をマスクして再構築することで実現できる。
  • 1つのTransformerバックボーンを用いて、段階的自己回帰的拡散とは異なり、すべての拡散ステップを同時に最適化することで、パラメータ数と推論時間を削減する。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的かつ並列的なVQトークン予測機構は、画像生成の面で自己回帰的モデルを速度と解像度の面で上回ることができるか?
  • RQ21つのTransformerモデルは、ランダムにマスクされた順序に依存しない入力から、効果的にVQトークンを再構築できるか?
  • RQ3モデルは、元の訓練解像度を上回るサイズの画像を生成しながらも、グローバルな一貫性を維持できるか?
  • RQ4提案手法は、尤度ベースの指標(密度、カバレッジ)とFIDにおいて、訓練および推論コストを削減しながら最先端の性能を達成できるか?
  • RQ5GANベースの手法とは異なり、局所的な画像編集と画像ごとの尤度推定をサポートできるか?

主な発見

  • LSUN Bedroomでは1.51、LSUN Churchesでは1.12、FFHQでは1.20という最先端の密度スコアを達成した。
  • LSUN Bedroomでは0.83、LSUN Churchesでは0.73、FFHQでは0.80という最先端のカバレッジスコアを達成した。
  • LSUN Bedroomでは3.64、LSUN Churchesでは4.07、FFHQでは6.11という競争力のあるFIDスコアを達成し、StyleGAN2を除くほとんどのベースラインを上回った。
  • コンテキストウィンドウの集約と並列的トークン予測のおかげで、元の訓練データを上回る解像度の画像を生成できた。
  • 自己回帰的VQ-VAEモデルと比較して、計算コストと訓練データ要件を削減しながら、高速なサンプリングと局所的な画像編集を実現した。
  • GANベースのモデルとは異なり、画像ごとの尤度推定を提供するという主な利点があり、評価の向上や条件付き生成の可能性を高めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。