Skip to main content
QUICK REVIEW

[論文レビュー] clip2latent: Text driven sampling of a pre-trained StyleGAN using denoising diffusion and CLIP

Justin N. M. Pinkney, Chuan Li|arXiv (Cornell University)|Oct 5, 2022
Generative Adversarial Networks and Image Synthesis被引用数 8
ひとこと要約

この論文では、微調整や外部のテキスト-画像データを一切使用せずに、CLIP埋め込みをガイドとして使用して事前学習済みのStyleGANの潜在変数を条件付き拡散モデルでサンプリングする方法であるclip2latentを紹介する。これにより、テキストから画像を生成可能となる。本手法は、最小限の学習計算コストで1秒未塔の高速な1024×1024解像度の高精細な画像合成を実現し、テキストプロンプトとの強い整合性を達成する。

ABSTRACT

We introduce a new method to efficiently create text-to-image models from a pre-trained CLIP and StyleGAN. It enables text driven sampling with an existing generative model without any external data or fine-tuning. This is achieved by training a diffusion model conditioned on CLIP embeddings to sample latent vectors of a pre-trained StyleGAN, which we call clip2latent. We leverage the alignment between CLIP's image and text embeddings to avoid the need for any text labelled data for training the conditional diffusion model. We demonstrate that clip2latent allows us to generate high-resolution (1024x1024 pixels) images based on text prompts with fast sampling, high image quality, and low training compute and data requirements. We also show that the use of the well studied StyleGAN architecture, without further fine-tuning, allows us to directly apply existing methods to control and modify the generated images adding a further layer of control to our text-to-image pipeline.

研究の動機と目的

  • 微調整や外部データを一切使用せずに、事前学習済みのStyleGANとCLIPのみを用いてテキストから画像を生成すること。
  • CLIPのテキスト埋め込みを条件として、StyleGANの潜在コードを生成する条件付き拡散モデルの開発。
  • ラベル付き画像-テキストペアを必要とせず、最小限の計算コストで高解像度かつ高精細な画像生成を達成すること。
  • 後続の編集に適したStyleGANの階層的潜在空間の制御性を維持すること。
  • 事前学習済みモデルを拡散モデルで接続することで、データフリーな強力なテキストから画像へのパイプラインを構築できることを示すこと。

提案手法

  • CLIPの対応する画像・テキスト空間の整合性を活用し、CLIPのテキスト埋め込みを条件として、StyleGANの潜在コードを生成するノイズ除去拡散モデルを学習する。
  • ペアデータを必要とせず、CLIPの固定済みの画像およびテキストエンコーダーを用いてプロンプトを埋め込み、潜在変数のサンプリングをガイドする。
  • CLIPのテキスト埋め込みを条件として、意味的に関連する画像に対応するStyleGANのW空間の潜在変数を生成する。
  • 推論時に拡散モデルからサンプリングし、直接StyleGANの潜在空間内で高解像度(1024×1024)の画像を生成する。
  • StyleGANの潜在空間の階層的構造を活用し、既知の潜在方向手法による細分化された編集を可能にする。
  • 設計上、生成された潜在変数がStyleGANの有効な多様体内に自然に位置することを保証し、最適化ベースの手法で一般的に生じるアーチファクトを回避する。

実験結果

リサーチクエスチョン

  • RQ1ラベル付き画像-テキストペアデータを一切使用せずに、CLIPのテキスト埋め込みからStyleGANの潜在変数を生成する条件付き拡散モデルを学習できるか?
  • RQ2本手法は、高解像度(1024×1024)の画像生成を高精細かつ最小限のアーチファクトで達成できるか?
  • RQ3事前学習済みで固定されたStyleGANを用いることで、既知の潜在空間方向を用いた制御可能な画像編集が可能になるか?
  • RQ4本手法の性能は、微調整やペアデータを必要とする既存のテキストから画像へのモデルと比較してどうか?
  • RQ5本手法は顔生成モデルに限らず、例えば風景スタイルのGANのような非顔生成モデルに対しても一般化可能か?

主な発見

  • 本手法は、テキストプロンプトから高解像度(1024×1024)の画像を生成し、CLIPとの整合性が高く、アーチファクトも最小限に抑えられ、優れた知覚的品質を達成する。
  • 推論は高速であり、事前学習済みのStyleGANを用いて1秒未塔でメガピクセルスケールの画像を生成可能である。
  • 生成された潜在変数は、CLIPの事前学習済みのテキスト・画像埋め込み間の整合性に依存するだけで、画像-テキストペアデータを一切使用せずに学習されている。
  • 生成された潜在変数は自然にStyleGANのW空間の有効な多様体内に位置し、InterfaceGANのような既知の潜在方向手法による高品質な編集が可能である。
  • LHQデータセットで学習した256×256のStyleGAN3風景モデルを用いた実験により、本手法が非顔モデルに対しても一般化可能であることが示された。
  • 定性的な比較により、最適化ベースの潜在変数逆引き手法と比較して、編集性とアーチファクト低減の両面で本手法が優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。