[論文レビュー] FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing
FineMoGen は、空間的・時間的依存関係を明示的にモデル化するための新規な Spatio-Temporal Mixture Attention (SAMI) メカニズムを活用した、微細な時空間的動き生成および編集を目的とした拡散ベースのフレームワークであり、ゼロショットおよび完全教師あり設定の両方で最先端の性能を達成している。さらに、大規模言語モデル(LLM)を介したインタラクティブな動き編集を可能とし、テキストから動きを生成する際の制御性とユーザーインターフェースを著しく向上させている。
Text-driven motion generation has achieved substantial progress with the emergence of diffusion models. However, existing methods still struggle to generate complex motion sequences that correspond to fine-grained descriptions, depicting detailed and accurate spatio-temporal actions. This lack of fine controllability limits the usage of motion generation to a larger audience. To tackle these challenges, we present FineMoGen, a diffusion-based motion generation and editing framework that can synthesize fine-grained motions, with spatial-temporal composition to the user instructions. Specifically, FineMoGen builds upon diffusion model with a novel transformer architecture dubbed Spatio-Temporal Mixture Attention (SAMI). SAMI optimizes the generation of the global attention template from two perspectives: 1) explicitly modeling the constraints of spatio-temporal composition; and 2) utilizing sparsely-activated mixture-of-experts to adaptively extract fine-grained features. To facilitate a large-scale study on this new fine-grained motion generation task, we contribute the HuMMan-MoGen dataset, which consists of 2,968 videos and 102,336 fine-grained spatio-temporal descriptions. Extensive experiments validate that FineMoGen exhibits superior motion generation quality over state-of-the-art methods. Notably, FineMoGen further enables zero-shot motion editing capabilities with the aid of modern large language models (LLM), which faithfully manipulates motion sequences with fine-grained instructions. Project Page: https://mingyuan-zhang.github.io/projects/FineMoGen.html
研究の動機と目的
- テキスト駆動型動き生成における微細な制御の欠如、特に身体部位ごとの詳細な時空間的動作を指定できない問題に対処すること。
- 自然言語の指示を用いてゼロショットで動きを編集可能とし、ユーザーのインタラクションと適応性を向上させること。
- 微細な時空間的アノテーションを備えた、微細な動き生成のための大規模なベンチマークを確立すること。
- アテンションメカニズムに空間的・時間的構成を明示的にモデル化することで、動き生成の質を向上させること。
提案手法
- アテンションにおける空間的および時間的モデリングを分離することで、グローバルなアテンションテンプレートの学習を改善する、空間的・時間的混合アテンション(SAMI)メカニズムを提案する。
- 微細な特徴を効果的に抽出できるようにするため、スパースに活性化されるエキスパートの混合(MoE)を導入し、特徴品質とモデル効率を向上させる。
- 訓練および推論の両方で、単一テキスト記述および微細なマルチパーツ記述をサポートし、柔軟な条件注入を可能にする。
- 大規模言語モデル(LLM)を統合し、自然言語による編集を解釈し、微細な動き記述を自動で修正可能にする。
- 7つの身体部位および動き段階にわたる、合計 2,968 本の動画と 102,336 個の微細な時空間的アノテーションを含む HuMMan-MoGen データセットを構築する。
- 標準ベンチマーク(HumanML3D、KIT-ML、BABEL)および新しい HuMMan-MoGen データセットを、ゼロショットおよび完全教師あり設定の両方で訓練および評価する。
実験結果
リサーチクエスチョン
- RQ1拡散モデルは、微細なマルチパーツ時空間的記述を正確に再現する人間の動きシーケンスを生成できるか?
- RQ2動き生成における空間的・時間的依存関係をよりよくモデル化するため、アテンションメカニズムをどのように再構築できるか?
- RQ3微細な記述に対する完全な教師あり学習がなくても、モデルはどの程度ゼロショットでの動き生成に一般化できるか?
- RQ4大規模言語モデルを効果的に統合することで、自然言語ベースのインタラクティブな動き編集が可能になるか?
- RQ5明示的な時空間的構成モデリングは、動きの質および一貫性をどの程度向上させるか?
主な発見
- ゼロショット評価において、FineMoGen は HuMMan-MoGen テストセットで最高の R-Precision スコア 0.51 を達成し、ベースライン手法を上回った。
- FID スコアが 1.09 にまで低下し、ベースラインの FID 2.87 と比較して、動きの質が著しく向上した。
- アブレーションスタディにより、空間的および時間的独立成分の両方が重要であることが確認され、SAMI + MoE の完全な構成が最良のパフォーマンスを示した。
- LLM の統合により、自然言語コマンドによるユーザーによる動きシーケンスの編集が効果的に可能になった。
- HuMMan-MoGen データセットは、102,336 個の微細なアノテーションを備えた包括的なベンチマークを提供し、微細な動き生成のスケールアップ研究を可能にした。
- モデルは高い多様性(5.71)とマルチモーダルリティ(5.17)を維持しており、異なる動きスタイルへの強靭性と一般化能力が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。