[論文レビュー] Unified Human-Scene Interaction via Prompted Chain-of-Contacts
本稿では、自然言語コマンドを用いて多様で長時間にわたる物理的相互作用を可能にする統合的ヒューマン・シーン相互作用フレームワーク、UniHSIを提案する。相互作用を連鎖的な接触対(Chain of Contacts)としてモデル化することで、LLMベースのプランナがタスク計画を生成し、統合型コントローラがそれを実行する。これにより、アノテーションフリーの学習と、実際のスキャン済みシーンにおける強力な一般化性能を達成する。
Human-Scene Interaction (HSI) is a vital component of fields like embodied AI and virtual reality. Despite advancements in motion quality and physical plausibility, two pivotal factors, versatile interaction control and the development of a user-friendly interface, require further exploration before the practical application of HSI. This paper presents a unified HSI framework, UniHSI, which supports unified control of diverse interactions through language commands. This framework is built upon the definition of interaction as Chain of Contacts (CoC): steps of human joint-object part pairs, which is inspired by the strong correlation between interaction types and human-object contact regions. Based on the definition, UniHSI constitutes a Large Language Model (LLM) Planner to translate language prompts into task plans in the form of CoC, and a Unified Controller that turns CoC into uniform task execution. To facilitate training and evaluation, we collect a new dataset named ScenePlan that encompasses thousands of task plans generated by LLMs based on diverse scenarios. Comprehensive experiments demonstrate the effectiveness of our framework in versatile task execution and generalizability to real scanned scenes. The project page is at https://github.com/OpenRobotLab/UniHSI .
研究の動機と目的
- ヒューマン・シーン相互作用(HSI)システムにおいて、多様な相互作用制御とユーザーフrndリーなインターフェースの欠如に対処すること。
- 従来の手法が狭い種類の相互作用しかサポートせず、多数のヒューマンアノテート済み運動データを必要としているという制限を克服すること。
- 統合的かつスケーラブルなフレームワークを用いて、長時間にわたる複数ラウンドの遷移を実現すること。
- 言語入力とシーンの意味情報を用いるだけで、細分化された複数対象の相互作用を可能にするシステムを開発すること。
- ヒューマンアノテート済み相互作用データセットへの依存を減らし、LLMを活用して相互作用計画を生成することで、データ収集コストを大幅に削減すること。
提案手法
- ヒューマン・シーン相互作用を連鎖的接触対(Chain of Contacts, CoC)として定義:人間の関節と物体部品の接触ペアが連続的に配置され、相互作用のダイナミクスを捉える。
- 自然言語コマンドを構造的なCoCタスク計画に変換するため、プロンプト工学を用いた大規模言語モデル(LLM)プランナを活用する。
- タスクパーサを備えた統合コントローラを設計。関節ポーズと物体のポイントクラウドを処理し、一様なタスク観測と目的を生成する。
- 敵対的運動事前知識と物理シミュレーションを統合し、現実的で物理的に妥当な運動生成を保証する。
- LLMが生成した相互作用計画を活用することで、相互作用アノテーションなしにエンドツーエンドで学習する。
- PartNetおよびScanNetベースのシーンから得たLLM生成相互作用計画を数千件含むScenePlanデータセットを構築し、学習と評価に用いる。
実験結果
リサーチクエスチョン
- RQ1統合フレームワークは、自然言語コマンドのみを用いて多様なヒューマン・シーン相互作用をサポートできるか?
- RQ2接触連鎖(CoC)形式は、複数ラウンドや複数対象の相互作用を含む、複数の相互作用タイプに一般化可能か?
- RQ3ヒューマンアノテートデータなしで、LLMが正確で実行可能な相互作用計画を効果的に生成できるか?
- RQ4統合コントローラは、合成学習環境を超えて、実際のスキャン済み3Dシーンへどの程度一般化できるか?
- RQ5このフレームワークは、関節と物体部品の正確な協調制御を伴い、細分化された長時間にわたる制御をどの程度実現できるか?
主な発見
- UniHSIは、自然言語コマンドのみを用いて、多様な相互作用の統合的で長時間にわたる制御を実現。例えば、手を腕に置いたり、膝を上げてベッドの上に横になったりするような複雑な遷移も可能。
- フレームワークは、15の全身関節と任意の物体部品に対する細分化された制御をサポートし、複数対象および複数接触の相互作用を可能にする。
- ScenePlanデータセットには、2つのバージョンで合計1,000件以上の独自の相互作用計画が含まれ、ベッドの上に横になる、肘を机に置いたりするような複雑な行動の詳細な接触形成を含む。
- 実験の結果、ScanNetの実際のスキャン済みシーンへの一般化性能が強く示され、合成学習データを超えた頑健性を確認した。
- システムは相互作用アノテーションフリーであり、ヒューマンアノテートデータに依存せず、LLMが生成した計画に依存する。これにより、従来手法と比較してデータ収集コストを大幅に削減した。
- 先行SOTA手法と比較して、UniHSIは唯一、統合的相互作用、言語入力、長時間にわたる遷移、アノテーションフリーの学習、全身関節制御を同時に実現している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。