[論文レビュー] IMos: Intent-Driven Full-Body Motion Synthesis for Human-Object Interactions
IMoSは、自然言語による指示に基づき、仮想キャラクターが3Dオブジェクトと相互作用する多様でフルボディのモーショングレーディングを生成する、意図駆動型の新規フレームワークを提案する。アームとボディのための分離された条件付き変分自己回帰モデルを用い、6自由度(6-DoF)のオブジェクトポーズを共同で最適化することで、現実的で多様なヒューマンオブジェクト相互作用を実現し、意図駆動型モーショングレーディング分野で最先端の結果を達成した。
Can we make virtual characters in a scene interact with their surrounding objects through simple instructions? Is it possible to synthesize such motion plausibly with a diverse set of objects and instructions? Inspired by these questions, we present the first framework to synthesize the full-body motion of virtual human characters performing specified actions with 3D objects placed within their reach. Our system takes textual instructions specifying the objects and the associated intentions of the virtual characters as input and outputs diverse sequences of full-body motions. This contrasts existing works, where full-body action synthesis methods generally do not consider object interactions, and human-object interaction methods focus mainly on synthesizing hand or finger movements for grasping objects. We accomplish our objective by designing an intent-driven fullbody motion generator, which uses a pair of decoupled conditional variational auto-regressors to learn the motion of the body parts in an autoregressive manner. We also optimize the 6-DoF pose of the objects such that they plausibly fit within the hands of the synthesized characters. We compare our proposed method with the existing methods of motion synthesis and establish a new and stronger state-of-the-art for the task of intent-driven motion synthesis.
研究の動機と目的
- 自然言語による指示に基づき、仮想キャラクターが3Dオブジェクトと指定された動作を行う多様でフルボディのモーションシーケンスを合成すること。
- 既存の手法が手や指の動きに限定されているか、ヒューマンオブジェクト相互作用におけるフルボディの協調性をモデル化できないというギャップを埋めること。
- 頭部の向きに関する明示的な教師信号なしに、頭部、胴体、腕、手の動きを協調的に行う現実的で物理的に整合性のあるモーションを生成すること。
- モーションシーケンス中に正確で安定した grasping を確保するために、リアルタイムで6-DoFのオブジェクトポーズを最適化すること。
- 統一された生成フレームワーク内で、片手および両手の相互作用、およびオフハンド(手から手への移行)を含む、両方の状況をサポートすること。
提案手法
- アームとボディの残りの部分のための2つの分離された条件付き変分自己回帰モデルを用い、精度の向上を図るために別々の潜在空間でモーショングレーディングをモデル化する。
- CLIPに基づく「コンディションエンコーダー」が、テキスト指示(意図とオブジェクトタイプ)を符号化し、自己回帰的モーショングレーディングプロセスを条件づける。
- 自己回帰的で、変分推論に基づくアプローチを用い、短い履歴から将来のボディポーズを生成することで、潜在空間からの多様なモーションサンプリングを可能にする。
- オブジェクト最適化モジュールが、グリッピング制約を満たすためにオブジェクトの6-DoFポーズを共同で最適化し、物理的妥当性と接触の正確性を保証する。
- スイッチングフレームの検出とハンドパラメータの転送により、静的グリッピングと動的移行(例:オフハンド)を含む、両方の状況をフレームワークでサポートする。
- モデルはGRABデータセットで学習され、スパースマーカーに基づくモーショングレーディングが活用され、オブジェクト-ハンド接触の精錬と相互侵入の低減のための後処理が施されている。
実験結果
リサーチクエスチョン
- RQ1単一のフレームワークが、自然言語による指示のみで多様でフルボディのモーションシーケンスをヒューマンオブジェクト相互作用に対して生成できるか?
- RQ2アームとボディのモーションモデリングを分離することで、統合的モデリングと比較して、合成された相互作用の品質と精度が向上するか?
- RQ3頭部方向に関する明示的な教師信号なしに、モデルが視覚的に妥当な頭部の向きと協調的なハンド-ヘッドモーションを学習できるか?
- RQ46-DoFオブジェクトポーズ最適化は、モーションシーケンス中に安定的かつ接触に整合したグリッピングを達成するためにどの程度有効か?
- RQ5オフハンドや高周波数の手首の動きを伴う動的グリッピングを含む、複雑な相互作用にも一般化可能か?
主な発見
- 提案手法は、定量的指標と主観的評価の両面で、意図駆動型フルボディモーショングレーディング分野で新たな最先端の結果を達成した。
- アームとボディの分離自己回帰モデリングにより、特に細かい指先や腕の協調性において、明確な主観的改善が得られた。
- 同じ指示からも、変分潜在空間からのサンプリングによって多様なモーションシーケンスを生成でき、強力な一般化能力と表現力の高さを示した。
- 明示的な教師信号なしに、モデルは視覚的に妥当な頭部の向きと協調的なハンド-ヘッドモーションを学習しており、エンドツーエンド学習からこのような協調性が自己生成される可能性を示唆している。
- オブジェクト最適化モジュールは、相互侵入の低減と接触精度の向上に成功したが、回転や伸縮を伴う動的グリッピングでは課題が残っている。
- 「squeeze」や「shake」のようなレアで高周波数の動作では失敗ケースが発生し、急速な手首の動きを捉える能力に制限があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。