Skip to main content
QUICK REVIEW

[論文レビュー] BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion

Jinheng Xie, Yuexiang Li|arXiv (Cornell University)|Jul 20, 2023
Generative Adversarial Networks and Image SynthesisComputer Science被引用数 3
ひとこと要約

BoxDiffは、事前学習済みの拡散モデルのノイズ除去プロセスに、内側ボックス、外側ボックス、コーナー制約を直接統合することで、トレーニング不要の方法として、テキストから画像への合成においてオブジェクトの位置とスケールを、境界ボックスやスケッチなどの単純な空間的制約によって制御する。この手法は、追加のトレーニングやペairedレイアウトデータを必要とせず、高精細で多様な画像生成を達成し、YOLOスコアおよびT2I-Simにおいて完全に教師ありのベースラインを顕著に上回る。

ABSTRACT

Recent text-to-image diffusion models have demonstrated an astonishing capacity to generate high-quality images. However, researchers mainly studied the way of synthesizing images with only text prompts. While some works have explored using other modalities as conditions, considerable paired data, e.g., box/mask-image pairs, and fine-tuning time are required for nurturing models. As such paired data is time-consuming and labor-intensive to acquire and restricted to a closed set, this potentially becomes the bottleneck for applications in an open world. This paper focuses on the simplest form of user-provided conditions, e.g., box or scribble. To mitigate the aforementioned problem, we propose a training-free method to control objects and contexts in the synthesized images adhering to the given spatial conditions. Specifically, three spatial constraints, i.e., Inner-Box, Outer-Box, and Corner Constraints, are designed and seamlessly integrated into the denoising step of diffusion models, requiring no additional training and massive annotated layout data. Extensive experimental results demonstrate that the proposed constraints can control what and where to present in the images while retaining the ability of Diffusion models to synthesize with high fidelity and diverse concept coverage. The code is publicly available at https://github.com/showlab/BoxDiff.

研究の動機と目的

  • 追加のトレーニングや大規模なアノテート済みレイアウトデータを必要とせずに、テキストから画像への拡散モデルにおける細かい空間的制御を可能にすること。
  • レイアウトから画像への合成におけるデータ効率のボトルネックを解消するため、教師ありデータ依存を最小限のユーザー提供空間条件に置き換えること。
  • Stable Diffusionのような事前学習済み拡散モデルの強力なゼロショット一般化能力と高精細な生成能力を維持すること。
  • 空間的制約を用いて既存の条件付き生成モデルを改善するための即挿し可能なソリューションを提供すること。

提案手法

  • 各ノイズ除去ステップにおいて、クロスアテンションマップに内側ボックス、外側ボックス、コーナー制約の3つの空間的制約を統合する。
  • 計算コストと精度のバランスを考慮し、16×16の空間解像度でのクロスアテンション特徴量に対してのみ制約を適用する。
  • ノイズ除去中に画像品質が低下する可能性のある過剰制約効果を軽減するために、代表的サンプリングを用いる。
  • Stable Diffusionに既存のクロスアテンションメカニズムを活用し、ユーザー指定の空間的条件に沿ったノイズ除去プロセスをガイドする。
  • モデルの微調整や再トレーニングを一切行わず、推論時のみに動作する。
  • ユーザーが提供するボックスやスケッチを、モデル重みを変更せずに、暗黙の空間的ガイダンスとして扱い、生成プロセスを制御する。

実験結果

リサーチクエスチョン

  • RQ1微調整や大規模なペアドレイアウトデータを必要とせずに、テキストから画像への生成における空間的制御を達成できるか?
  • RQ2境界ボックスのような単純なユーザー提供条件を、拡散ベースの画像生成におけるオブジェクト配置とスケールのガイドに効果的に活用する方法は何か?
  • RQ3ノイズ除去プロセスに空間的制約を統合する際、画像品質や意味的忠実度が低下することなく、どの程度まで統合可能か?
  • RQ4提案手法は、閉じたセットのトレーニング分布を超えた新しいオブジェクトカテゴリに対しても一般化可能か?
  • RQ5オブジェクト検出および意味的整合性の指標において、完全に教師ありのレイアウトから画像へのモデルと比較して、定量的にどの程度優れているか?

主な発見

  • BoxDiffはStable Diffusionと組み合わせた際、YOLOスコア22.3を達成し、LostGAN(5.3)、LAMA(10.2)、TwFA(10.6)といった完全に教師ありの手法を顕著に上回った。
  • T2I-Simスコアが0.3513に向上し、生成画像とテキストプロンプトとの間の優れた意味的整合性を示した。
  • GLIGENと統合した場合、YOLOスコアは40.2から46.2に、T2I-Simは0.3511から0.3513に向上し、即挿し可能なコンponentとしての有効性を実証した。
  • オブジェクトのスケールを正確に制御できた:条件付きボックスが拡大するに従い、城は小さくから大きく成長した一方、他のコンテンツは固定されたままだった。
  • 同じ条件付きボックス内で、コンテンツ(例:草原、ひまわり、スワmps)とスケールを同時に変更するような、マルチレベルのバリエーションを生成可能だった。
  • 視覚的結果から、テキストプロンプトに「中央に」などの位置的ヒントが含まれていても、オブジェクトの位置が提供されたボックスに正確にずれるのを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。