Skip to main content
QUICK REVIEW

[論文レビュー] LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation

Leigang Qu, Shengqiong Wu|arXiv (Cornell University)|Aug 9, 2023
Generative Adversarial Networks and Image Synthesis被引用数 7
ひとこと要約

本稿では、テキストプロンプトから意味的なレイアウトを自動的に生成することで、手動のガイドなしに高忠実度の画像合成を実現する、新しいテキストto画像生成フレームワークであるLayoutLLM-T2Iを提案する。大規模言語モデル(LLMs)を活用し、フィードバックベースのサンプリングを用いたコンテキスト内学習により、LLMsからレイアウト計画を引き出す。さらに、微細な画像生成のための関係に配慮した拡散モデルを採用することで、COCO 2014でレイアウトの正確性と画像忠実度の両面で最先端の性能を達成した。

ABSTRACT

In the text-to-image generation field, recent remarkable progress in Stable Diffusion makes it possible to generate rich kinds of novel photorealistic images. However, current models still face misalignment issues (e.g., problematic spatial relation understanding and numeration failure) in complex natural scenes, which impedes the high-faithfulness text-to-image generation. Although recent efforts have been made to improve controllability by giving fine-grained guidance (e.g., sketch and scribbles), this issue has not been fundamentally tackled since users have to provide such guidance information manually. In this work, we strive to synthesize high-fidelity images that are semantically aligned with a given textual prompt without any guidance. Toward this end, we propose a coarse-to-fine paradigm to achieve layout planning and image generation. Concretely, we first generate the coarse-grained layout conditioned on a given textual prompt via in-context learning based on Large Language Models. Afterward, we propose a fine-grained object-interaction diffusion method to synthesize high-faithfulness images conditioned on the prompt and the automatically generated layout. Extensive experiments demonstrate that our proposed method outperforms the state-of-the-art models in terms of layout and image generation. Our code and settings are available at https://layoutllm-t2i.github.io.

研究の動機と目的

  • 複雑なシーンにおけるテキストto画像拡散モデルの空間的不整合性と関係理解の不足という、長年の問題に取り組む。
  • スケッチやスクラッチなどの手動ガイドに依存せず、テキストプロンプトから意味的に正確なレイアウトを自動生成することで、その依存を排除する。
  • LLMによるレイアウト計画を統合することで、拡散モデルに粗いから細かい段階での画像生成能力を付与する。
  • 関係に配慮した拡散モジュールを用いて微細なオブジェクト間相互作用をモデル化することで、画像忠実度を向上させる。
  • LLMsからレイアウト推論を引き出すために、フィードバックベースのコンテキスト内学習の有効性を検証する。

提案手法

  • GPT-3.5などのLLMsを、テキストプロンプトから粗いレイアウトを生成するように、フィードバックベースのサンプリング戦略を用いたコンテキスト内学習でプロンプトする。
  • U-Netアーキテクチャ内にレイアウトに配慮した空間変換器(La-UNet)を採用し、レイアウトとテキスト特徴量を効果的に統合して画像生成を実現する。
  • 主語-関係-目的語の三項組み合わせをモデル化する関係に配慮した相互作用モジュールを導入し、拡散過程における空間的および意味的関係理解を強化する。
  • 二段階の生成プロセスを適用する:まずLLMsでレイアウトを生成し、次にそのプロンプトと生成されたレイアウトに条件づけた高忠実度の画像を合成する。
  • 少数ショットプロンプティングにおける最近傍例選択にCLIPベースのテキスト類似度を用い、レイアウトの正確性を向上させる。
  • 入力テキスト、抽出された関係三項組み、生成されたレイアウトを別々に埋め込むプロンプトエンコーダーを採用し、統合モデリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは、自然言語記述から意味的かつ空間的に整合性のあるレイアウトを効果的に生成できるか?
  • RQ2フィードバックベースのコンテキスト内学習は、ランダムまたは最近傍例サンプリングと比較して、レイアウト生成性能をどのように向上させるか?
  • RQ3関係に配慮したオブジェクト相互作用モデリングを統合することで、テキストto画像生成における画像忠実度はどの程度向上するか?
  • RQ4完全に自動的でガイドなしのアプローチは、人為的レイアウトヒントに依存する既存手法を上回ることができるか?
  • RQ5ショット数(ゼロショット対少々ショット)が、この設定におけるLLMsのレイアウト計画能力に与える影響は何か?

主な発見

  • フィードバックベースのコンテキスト内学習戦略は、ランダムおよび最近傍例サンプリングを著しく上回り、レイアウト生成において最高のmIoUおよびLaySimスコアを達成した。
  • ゼロショット設定ですでに競争力のあるレイアウト生成性能を示しており、レイアウト推論における強力な少々ショット一般化能力とインダクティブバイアスを示している。
  • コンテキスト例の数を増やすことでレイアウト性能が向上し、4ショットまで向上が見られたが、以降は利得が飽和し、中程度の少々ショット設定を超えるとリターンが減少する傾向を示した。
  • 関係に配慮した相互作用モジュールは、特に「意味的(Semantic)」および「混合(Mixed)」関係カテゴリにおいて、画像品質に顕著な向上をもたらした。これは、マルチモーダル理解におけるその重要性を示している。
  • 定性的な結果から、LayoutLLM-T2Iは、レイアウトDMやベースライン拡散モデルと比較して、より正確なオブジェクト配置と関係の描写を実現しており、複雑なシーンではグランドトゥルースレイアウトベースラインでさえも上回った。
  • COCO 2014テストセットにおいて、数値的・空間的・意味的・複雑・抽象的の5つのレイアウトカテゴリで最先端の結果を達成した。これは、多様なプロンプトタイプにわたる強力な耐性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。