Skip to main content
QUICK REVIEW

[論文レビュー] Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models

Pablo Pernias, Dominic Rampas|arXiv (Cornell University)|Jun 1, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

Würstchenは、条件付けに42:1の高圧縮潜在空間を用いる3段階のテキストから画像への拡散アーキテクチャを導入し、24,602 A100-GPU時間(Stable Diffusion 2.1の200,000時間と比較して8倍低い)という低コストで最先端の画像生成品質を達成した。この手法により、解像度を落とさずに忠実度や整合性を損なわず、高速な推論と低炭素排出量を実現した。

ABSTRACT

We introduce Würstchen, a novel architecture for text-to-image synthesis that combines competitive performance with unprecedented cost-effectiveness for large-scale text-to-image diffusion models. A key contribution of our work is to develop a latent diffusion technique in which we learn a detailed but extremely compact semantic image representation used to guide the diffusion process. This highly compressed representation of an image provides much more detailed guidance compared to latent representations of language and this significantly reduces the computational requirements to achieve state-of-the-art results. Our approach also improves the quality of text-conditioned image generation based on our user preference study. The training requirements of our approach consists of 24,602 A100-GPU hours - compared to Stable Diffusion 2.1's 200,000 GPU hours. Our approach also requires less training data to achieve these results. Furthermore, our compact latent representations allows us to perform inference over twice as fast, slashing the usual costs and carbon footprint of a state-of-the-art (SOTA) diffusion model significantly, without compromising the end performance. In a broader comparison against SOTA models our approach is substantially more efficient and compares favorably in terms of image quality. We believe that this work motivates more emphasis on the prioritization of both performance and computational accessibility.

研究の動機と目的

  • 大規模なテキストから画像への拡散モデルの訓練および推論における高い計算コストを低減すること。
  • 画像の品質や整合性を維持または向上させながら、訓練および推論コストを削減すること。
  • 高精細な生成モデルを消費者用ハードウェアでもより効率的かつスケーラブルに、かつアクセスしやすく展開できること。
  • 潜在表現の極度の圧縮が、意味的詳細を保持し、高精細な画像生成をガイドできることを示すこと。
  • パフォーマンスを損なわず計算効率を最適化し、持続可能な生成AIの発展を促進すること。

提案手法

  • 3段階のアーキテクチャを提案:段階Cは、テキスト条件付き潜在拡散モデル(LDM)を用いて42:1の高圧縮潜在表現を生成する。
  • 段階Bは、この圧縮された潜在空間を条件付けとして用い、VQGANベースのVQ-VAEを介してより高次元の4:1の圧縮潜在空間を再構築する2番目のLDMを用いる。
  • 段階Aは、VQGANデコーダーを用いて最終的な潜在表現をフル解像度の画像に変換する。
  • 訓練を逆順に実施:まずVQGAN(段階A)を訓練し、次に段階BのLDM、最後に段階CのLDMを訓練する。
  • 画像をコンactな潜在空間に写像するための意味的コンプレッサー(高圧縮エンコーダー)を用い、詳細な意味的情報を保持する。
  • 分類器フリーのガイダンス(CFG)とCLIPベースのテキストエンコーディングを用い、テキストプロンプトに基づいた画像生成を条件づける。

実験結果

リサーチクエスチョン

  • RQ142:1の高圧縮潜在空間(42:1)は、拡散モデルにおける高精細な画像生成をガイドするのに十分な意味的詳細を保持できるか?
  • RQ2このようなコンパクトな潜在空間上でテキスト条件付き拡散モデルを訓練することで、標準的なLDMと比較して訓練コストを削減しながら、画像品質を維持または向上させられるか?
  • RQ3高解像度画像生成と条件付けモデリングを分離する3段階のアーキテクチャは、推論時間と計算リソースの消費を顕著に削減できるか?
  • RQ4画像の忠実度、整合性、ユーザーの好みの観点から、Stable Diffusion 2.1などのSOTAモデルと比較して、このモデルのパフォーマンスはどの程度か?
  • RQ5この手法により、ハードウェアとエネルギーの要件を低減することで、高品質なテキストから画像への生成のアクセスをどの程度民主化できるか?

主な発見

  • Würstchenは、24,602 A100-GPU時間の訓練で最先端の性能を達成した。これはStable Diffusion 2.1の200,000 GPU時間と比較して8倍低い。
  • MS-COCOではFIDスコア2.53、Parti-promptsでは2.61を達成し、SD 2.1と同等またはそれ以上のスコアを記録した。PickScoreもMS-COCOで1.48、Parti-promptsで1.52を記録し、SD 2.1と同等以上であった。
  • 人間による好みの評価では、高関与参加者に限定して62%がParti-promptsでWürstchenを好んだ。MS-COCOでは54%がWürstchenを好んだ。
  • Würstchenの推論は、コンパクトな潜在空間のおかげでSD 2.1の2倍以上速く、遅延と炭素排出量を顕著に削減した。
  • 訓練データも少なく、自動評価指標および人間評価で整合性と視覚的品質が向上した。
  • 訓練および推論のコード、モデル重みを含むパイプライン全体がGitHubに公開され、再現性とコミュニティ利用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。