Skip to main content
QUICK REVIEW

[論文レビュー] Controlled and Conditional Text to Image Generation with Diffusion Prior

Pranav Aggarwal, Hareesh Ravi|arXiv (Cornell University)|Feb 23, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、大規模な拡散デコーダーを微調整せずに、特定のドメインやカラーパレットに条件付けられる軽量な拡散プライア(Diffusion Prior)を用いたハイブリッド拡散モデル(HDM)を提案する。この手法により、微調整を伴わず、効率的で高品質かつ制御可能なテキストから画像への生成が可能になる。本手法は、プロンプト工学や既存のベースラインと比較して、ドメイン特化型およびカラーパラメータ条件付きの画像生成において優れた性能を発揮する。

ABSTRACT

Denoising Diffusion models have shown remarkable performance in generating diverse, high quality images from text. Numerous techniques have been proposed on top of or in alignment with models like Stable Diffusion and Imagen that generate images directly from text. A lesser explored approach is DALLE-2's two step process comprising a Diffusion Prior that generates a CLIP image embedding from text and a Diffusion Decoder that generates an image from a CLIP image embedding. We explore the capabilities of the Diffusion Prior and the advantages of an intermediate CLIP representation. We observe that Diffusion Prior can be used in a memory and compute efficient way to constrain the generation to a specific domain without altering the larger Diffusion Decoder. Moreover, we show that the Diffusion Prior can be trained with additional conditional information such as color histogram to further control the generation. We show quantitatively and qualitatively that the proposed approaches perform better than prompt engineering for domain specific generation and existing baselines for color conditioned generation. We believe that our observations and results will instigate further research into the diffusion prior and uncover more of its capabilities.

研究の動機と目的

  • 大規模な拡散デコーダーを変更せずに、特定のドメインに画像生成を制約できるかどうかを検証すること。
  • 色ヒストограмを用いた条件付き生成(例:セマンティックおよびスタイリスティックな一貫性のガイド)において、拡散プライアの実用性を評価すること。
  • 大規模な拡散モデルを微調整するのと比較して、小規模でドメイン特化型の拡散プライアを訓練する方が、メモリおよび計算リソースの点でより効率的であることを示すこと。
  • 画像品質、セマンティック関連性、色再現性の観点から、本手法をプロンプト工学および既存のカラーテンプレート移行技術と比較すること。

提案手法

  • ドメイン特化型のテキスト-画像ペアを用いて、テキストプロンプトに条件付けられたCLIP-L/14画像埋め込みを生成する拡散プライアモデルを訓練し、ドメイン制御を実現する。
  • 生成されたCLIP埋め込みを、重みを変更せずに事前学習済みの潜在拡散モデル(LDM)デコーダーに条件付けとして入力し、最終的な画像を生成する。
  • 参照画像の色ヒストограмを拡散プライアに入力することで、色条件付き生成を追加し、セマンティックコンテンツを保持したまま実現する。
  • CLIP埋め込み空間を共通の中間表現として活用することで、画像生成における補間、操作、多様性の向上を実現する。
  • CLIPスコア、FID、ドメイン特化型分類器における分類精度といった指標を用いて、アプローチを評価する。
  • ドメイン特化型またはカラーパラメータ条件付きの拡散プライアと汎用的なLDMデコーダーを組み合わせることで、プラグアンドプレイによる制御が可能な新しいHDMアーキテクチャを確立する。

実験結果

リサーチクエスチョン

  • RQ1微調整を伴わず、小規模でドメイン特化型の拡散プライアモデルが、望ましいドメインに画像生成を制限できるか。
  • RQ2プロンプト工学と比較して、拡散プライアベースの手法がドメイン特化型画像生成においてどの程度の性能を示すか。
  • RQ3色ヒストограмなどの追加の条件入力を拡散プライアに拡張可能か。これにより、セマンティック品質を保持したまま画像生成をガイドできるか。
  • RQ4既存のカラーテンプレート移行技術と比較して、本手法が画像品質と色再現性のバランスをどのように改善しているか。
  • RQ5大規模な拡散モデルを微調整するのと比較して、HDMアーキテクチャがメモリおよび学習時間の点でより効率的か。

主な発見

  • 提案されたドメイン特化型拡散プライアは、孤立物体の分類器スコアが0.496を達成し、SD(0.268)およびSD-prompt(0.250)を大きく上回り、ドメイン整合性が優れていることを示している。
  • ベクトル画像の分野では、分類器スコアが0.950に達し、SD(0.550)およびSD-prompt(0.761)を上回り、ベクトルドメイン生成における強力な性能を示している。
  • テクスチャ生成では、分類器スコアが0.860に達し、SD(0.663)およびSD-prompt(0.788)を上回り、FID(35.524)も両ベースラインを下回っている。
  • カラーパラメータ条件付き生成では、ヘリンジャーディスタンスが0.480、KLダイバージェンスが3.164を記録し、色再現性と画像品質のバランスにおいて、SD+WCTRGB(0.468, 1.779)を上回っている。
  • カラーパラメータ条件付き生成におけるFIDは21.670を達成し、SD+WCTRGB(23.616)およびReHistoGAN(21.299)を上回り、優れた品質と色整合性を示している。
  • 定性的な結果から、モデルは意味的に整合性のある画像を生成していることが確認されている(例:青の例示画像に条件付けられるとベリーがブルーベリーに変換される)が、現実的でかつ全体的な色の歪みを避ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。