Skip to main content
QUICK REVIEW

[論文レビュー] OmniControl: Control Any Joint at Any Time for Human Motion Generation

Yiming Xie, Varun Jampani|arXiv (Cornell University)|Oct 12, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

OmniControlは、空間的および現実性ガイダンスの新しい組み合わせを用いて、任意の時間に任意の関節に対して正確な空間的制御を可能にする、テキスト条件付き人体運動生成モデルである。このモデルは、HumanML3DおよびKIT-MLにおいて、1つの統合モデルで複数関節制御と骨盤制御の両方において、従来手法を著しく上回る、最先端の制御精度と運動の現実性を達成している。

ABSTRACT

We present a novel approach named OmniControl for incorporating flexible spatial control signals into a text-conditioned human motion generation model based on the diffusion process. Unlike previous methods that can only control the pelvis trajectory, OmniControl can incorporate flexible spatial control signals over different joints at different times with only one model. Specifically, we propose analytic spatial guidance that ensures the generated motion can tightly conform to the input control signals. At the same time, realism guidance is introduced to refine all the joints to generate more coherent motion. Both the spatial and realism guidance are essential and they are highly complementary for balancing control accuracy and motion realism. By combining them, OmniControl generates motions that are realistic, coherent, and consistent with the spatial constraints. Experiments on HumanML3D and KIT-ML datasets show that OmniControl not only achieves significant improvement over state-of-the-art methods on pelvis control but also shows promising results when incorporating the constraints over other joints.

研究の動機と目的

  • テキスト条件付き運動生成の過程で、任意の時間に任意の人体関節に対して柔軟な空間的制御を可能にすること。
  • 従来のインpaintingベースの手法で見られる相対的ポーズ表現の制限を克服し、正確なグローバル空間的制御を実現すること。
  • 個々の関節ごとに別々のモデルを必要とせず、同時に複数の関節を制御できる統合モデルの開発。
  • 高い制御精度と運動の現実性の両立を図り、不自然な動きやドリフトを回避すること。

提案手法

  • 生成された運動をグローバル座標に変換することで、入力制御信号に対して勾配を計算する解析的空間ガイダンスを導入。これにより、直接的かつ正確な最適化が可能になる。
  • すべての層にわたり注意機構の特徴に残差を注入する現実性ガイダンスを採用。これにより、全身の運動が暗黙的かつ包括的に改善される。
  • モデルの入出力に相対的ポーズ表現を用いることで、効果を維持しつつ、ガイダンスモジュール内の座標変換によってグローバル制御を可能にする。
  • 推論時間と精度のバランスを図るため、繰り返し可能で動的な最適化戦略を採用。反復回数(Ke, Kl)としきい値(Ts)を設定可能にしている。
  • 空間ガイダンスと現実性ガイダンスを補完的に組み合わせる。空間ガイダンスは制約の遵守を保証し、現実性ガイダンスは運動の一貫性と物理的妥当性を維持する。
  • 1つのモデルを訓練して、複数関節の同時制御を可能に。これにより、環境や物体との複雑な相互作用が可能になる。

実験結果

リサーチクエスチョン

  • RQ11つの拡散モデルが、骨盤を越える関節に対しても、任意の時間に正確な空間的制御を達成できるか?
  • RQ2相対的ポーズに基づく運動生成フレームワークに、相対的位置の仮定に依存せずに、空間的制御信号を効果的に統合する方法は何か?
  • RQ3空間ガイダンスと現実性ガイダンスを組み合わせることで、制御精度と運動の現実性のバランスにどのような影響があるか?
  • RQ4統合モデルが複数の関節を同時に効果的に制御でき、複雑な人間-環境相互作用を可能にするか?
  • RQ5空間的制御信号の密度が異なる状況(特にスパarselyまたは密集して信号がある場合)において、モデルの性能はどのように変化するか?

主な発見

  • OmniControlは、密度の高い空間的信号を用いた骨盤制御において、ベースライン手法と比較して平均誤差(Avg. err.)を90%削減した。
  • ノイズの入力運動に対して勾配を計算する変種と比較して、平均誤差が83.8%削減された。これにより、本手法の勾配計算戦略の有効性が裏付けられた。
  • 現実性ガイダンスを導入しない場合、FIDが50%上昇し、運動の一貫性が著しく低下した。これは、現実性ガイダンスが物理的妥当性を維持するために不可欠であることを示している。
  • OmniControlは、信号密度の変化に関わらず安定した性能を維持したが、MDMとPriorMDMは信号密度が増加するにつれてFIDと足のスケーティング比が急激に上昇した。
  • OmniControlは、HumanML3DおよびKIT-MLの両データセットで最先端の結果を達成し、制御精度と運動の現実性の両面で、従来のアプローチを上回った。
  • 本手法は、複数関節制御を1つの統合フレームワークで実現でき、周囲の物体に生成された運動を接続するなど、複雑な下流応用を成功裏に実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。