Skip to main content
QUICK REVIEW

[論文レビュー] Language-driven Scene Synthesis using Multi-conditional Diffusion Model

An Vuong, Minh Nhat Vu|arXiv (Cornell University)|Oct 24, 2023
Human Motion and Animation被引用数 4
ひとこと要約

本論文は、テキストプロンプト、人間の動き、既存オブジェクトを用いて3Dシーンを生成する言語駆動型シーン合成タスクを導入し、ノイズ除去の際に明示的なガイドポイントを用いる新しいマルチ条件拡散モデルを活用する。この手法は、PRO-teXtおよびHUMANISEデータセットの両方で最先端の性能を達成し、FIDおよび3D IP指標においてベースラインを著しく上回り、テキストコマンドによるオブジェクト置換や形状の変更といった高度な編集アプリケーションを可能にする。

ABSTRACT

Scene synthesis is a challenging problem with several industrial applications. Recently, substantial efforts have been directed to synthesize the scene using human motions, room layouts, or spatial graphs as the input. However, few studies have addressed this problem from multiple modalities, especially combining text prompts. In this paper, we propose a language-driven scene synthesis task, which is a new task that integrates text prompts, human motion, and existing objects for scene synthesis. Unlike other single-condition synthesis tasks, our problem involves multiple conditions and requires a strategy for processing and encoding them into a unified space. To address the challenge, we present a multi-conditional diffusion model, which differs from the implicit unification approach of other diffusion literature by explicitly predicting the guiding points for the original data distribution. We demonstrate that our approach is theoretically supportive. The intensive experiment results illustrate that our method outperforms state-of-the-art benchmarks and enables natural scene editing applications. The source code and dataset can be accessed at https://lang-scene-synth.github.io/.

研究の動機と目的

  • テキスト、人間の動き、既存オブジェクトといった複数のモodalを統合するシーン合成のギャップを埋めるために、新しい言語駆動型シーン合成タスクを提案すること。
  • 従来の単一条件の合成手法が潜在空間における条件の暗黙的統合に依存するという制限を克服すること。
  • 空間的位置と形状の両方を捉える3Dポイントクラウドベースのシーン表現を構築し、より正確で詳細なシーン生成を実現すること。
  • 自然言語コマンドによるユーザーの操作を可能にする、実用的で直感的なシーン編集を可能にすること。

提案手法

  • 従来の研究とは異なり、ノイズ除去プロセスを誘導するためのガイドポイントを明示的にモデル化する3Dポイントクラウド生成のためのマルチ条件拡散モデルを提案する。
  • テキスト、動き、オブジェクト入力から予測されるガイドポイントという新しい概念を導入し、拡散プロセスのノイズ除去段階に直接影響を与える。
  • CLIPによるテキスト、PoseNetによる人間の動き、PointNet++/DGCNNによる3Dポイントクラウドを統合するユニフィードエンコーダアーキテクチャを採用し、クロスアテンション機構を用いて条件を統合する。
  • ガイドポイントの条件付きインジェクションを用いたノイズ除去U-Netを採用し、意味的かつ物理的に妥当なシーン生成に向けて逆方向の拡散プロセスを誘導する。
  • テキストプロンプトと生成された3Dシーンの整合性を向上させるために、対照学習に基づく損失関数を採用する。
  • ガイドポイントの有効性および部品選択の妥当性を確認するため、アブレーションスタディおよびユーザースタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1テキストプロンプト、人間の動き、既存オブジェクトを同時に条件として用いることで、マルチ条件拡散モデルが3Dシーンを効果的に合成できるか?
  • RQ2潜在空間における暗黙的統合と比較して、明示的なガイドポイント予測がマルチ条件拡散モデルの生成品質にどのように寄与するか?
  • RQ3オブジェクト置換、形状の変更、位置の変更といった言語駆動型シーン編集は、テキストコマンドによってどの程度達成可能か?
  • RQ4PointNet++、DGCNNなどの異なるバックボーンアーキテクチャや、CLIP、BERTなどの異なるテキストエンコーダーが、モデルの性能にどのように影響を与えるか?
  • RQ5ユーザースタディによって確認されたように、本手法は多様なデータセットおよびユーザープレファレンスに一般化可能か?

主な発見

  • 提案されたLSDMモデルは、PRO-teXtデータセットで3D IP 0.0402、FID 161.05を達成し、ATISS、SUMMON、MIMEを含むすべてのベースラインを上回る性能を示した。
  • HUMANISEデータセットでは、最先端の手法と比較してFIDが最低35%低減され、シーンの現実性が著しく向上していることが示された。
  • CLIP、POSA、PointNet++の組み合わせが、EMDおよびF1スコアで最高の性能を発揮し、最良の構成と比較してCDスコアでわずか0.1866の低下にとどまった。
  • アブレーションスタディの結果、CLIPとPointNet++を組み合わせた場合、POSAはP2Rに比べてF1スコアで約3倍高い性能を示した。
  • ユーザースタディの結果、LSDMで生成されたシーンは、自然さ、衝突なし、意図の一致の観点でベースラインと比較して顕著に高い評価を得た。
  • 本モデルは、人間のポーズフレーム数の変化に対しても安定した性能を示し、1フレームのみを用いても劣化が最小限に抑えられており、耐障害性と効率性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。