Skip to main content
QUICK REVIEW

[論文レビュー] HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation

Bo Cheng, Yuhang Ma|arXiv (Cornell University)|Oct 18, 2024
Computer Graphics and Visualization Techniques被引用数 4
ひとこと要約

HiCoは、空間的分離を実現するマルチブランチで重み共有された条件付け構造を用いた階層的制御可能拡散モデルを提案する。これにより、複雑なレイアウトにおけるオブジェクトの一貫性と画像品質が向上する。新しいHiCo-7KベンチマークおよびCOCO-3Kにおいて最先端の性能を達成し、FuseNet統合とLoRA/LCM統合による高速推論と制御性の向上を実現する。

ABSTRACT

The task of layout-to-image generation involves synthesizing images based on the captions of objects and their spatial positions. Existing methods still struggle in complex layout generation, where common bad cases include object missing, inconsistent lighting, conflicting view angles, etc. To effectively address these issues, we propose a extbf{Hi}erarchical extbf{Co}ntrollable (HiCo) diffusion model for layout-to-image generation, featuring object seperable conditioning branch structure. Our key insight is to achieve spatial disentanglement through hierarchical modeling of layouts. We use a multi branch structure to represent hierarchy and aggregate them in fusion module. To evaluate the performance of multi-objective controllable layout generation in natural scenes, we introduce the HiCo-7K benchmark, derived from the GRIT-20M dataset and manually cleaned. https://github.com/360CVGroup/HiCo_T2I.

研究の動機と目的

  • 複雑なシーンにおけるオブジェクトの欠落、照明の一貫性の欠如、視点の矛盾といった、レイアウトから画像生成における長年の問題に取り組む。
  • 複数の条件付けブランチを用いてレイアウトを階層的にモデル化することで、空間的分離と構成の調和を向上させる。
  • 自然なシーンにおけるマルチオブジェクトで制御可能なレイアウト生成を評価するための新しい高品質ベンチマーク、HiCo-7Kを提供する。
  • LoRA、LCM、モデルチェックポイントの切り替えによる統合を通じて、柔軟なスケーラビリティを実現する。
  • 閉じたセットおよびオープンエンドドのレイアウト生成タスクの両方で優れた性能を示す。

提案手法

  • モデルは、各オブジェクトごとに階層的なレイアウト特徴を別々に抽出できるマルチブランチで重み共有されたアーキテクチャを採用し、局所的制御を可能にする。
  • FuseNetモジュールは、パrametricな方法で個々のオブジェクトブランチとグローバル背景ブランチからの特徴を、和、平均、またはアテンションベースのマスクを用いて統合する。
  • グローバル背景ブランチは、グローバルプロンプトを用いて全体のシーンの整合性と隠蔽順序をガイドする。
  • ControlNetやIP-Adapterと同様の条件付けブランチ構造を介して、事前学習済みテキストから画像への拡散モデル(例:Stable Diffusion)と統合する。
  • 推論は並列モードと逐次モードをサポートし、並列モードではオブジェクトブランチ全体でバッチ処理が可能で、高速化が実現される。
  • LoRA微調整およびLCM(潜在一貫性モデル)との互換性があり、高速で高品質な推論が可能になる。

実験結果

リサーチクエスチョン

  • RQ1レイアウト特徴の階層的モデリングは、複雑なレイアウトから画像生成におけるオブジェクトの一貫性と空間的整合性を向上させるか?
  • RQ2提案されたマルチブランチで統合された条件付け構造は、従来のトレーニングフリーおよびトレーニングベースの手法と比較して、複雑なレイアウトをどのように処理するか?
  • RQ3HiCoモデルは、高速推論とモデルの柔軟性を維持しつつ、どれほど高い画像品質と制御性を維持できるか?
  • RQ4新しいHiCo-7Kベンチマークは、自然なシーンにおけるレイアウトから画像生成を客観的に評価するためにどれほど有効か?
  • RQ5LoRAを用いて、オープンエンドで詳細なテキスト記述およびマルチコンセプト生成を効果的に処理できるか?

主な発見

  • HiCo-7Kオープンエンドベンチマークにおいて最先端の性能を達成し、Fréchet Inception Distance (FID) は15.26、Average Recall (AR) は39.51を記録した。
  • クローズドセットのCOCO-3Kデータセットにおいても、FID 18.78、AR 36.30を達成し、CAG や GLIGEN といった既存手法を上回った。
  • マスクベースの統合を用いたFuseNetモジュールが最良の結果をもたらし、HiCo-7KにおいてFIDを15.26まで低下させ、LocalIoUスコアを59.07まで向上させた。
  • 24GBのV100 GPU上で6つの比較モデルの中でも最も高速な推論時間と2番目に低いGPUメモリ使用量を達成し、512×512の画像生成時間が1秒未満であった。
  • LCMおよびLightning推論モードを介して高速推論が可能で、高品質なリアルタイム生成が実現した。
  • 主観評価では、重なったオブジェクトを含む複雑なレイアウトにおいても、ベースラインより調和的で現実的な画像を生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。