[論文レビュー] DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion
DiverseMotionは、テキストからモーショングenerationにおけるモーション品質と多様性のバランスで最先端の性能を達成する新しいモーション離散拡散(MDD)フレームワークを提案する。8,888本のモーションクリップと141万件の多様なキャプションを含む大規模なWild Motion-Caption(WMC)データセットを導入し、テキストの微細な意味を捉えるために階層的意味統合(HSA)モジュールを採用することで、HumanML3DおよびKIT-MLベンチマークにおいて高い生成品質を維持しつつ、モーションの多様性を顕著に向上させた。
We present DiverseMotion, a new approach for synthesizing high-quality human motions conditioned on textual descriptions while preserving motion diversity.Despite the recent significant process in text-based human motion generation,existing methods often prioritize fitting training motions at the expense of action diversity. Consequently, striking a balance between motion quality and diversity remains an unresolved challenge. This problem is compounded by two key factors: 1) the lack of diversity in motion-caption pairs in existing benchmarks and 2) the unilateral and biased semantic understanding of the text prompt, focusing primarily on the verb component while neglecting the nuanced distinctions indicated by other words.In response to the first issue, we construct a large-scale Wild Motion-Caption dataset (WMC) to extend the restricted action boundary of existing well-annotated datasets, enabling the learning of diverse motions through a more extensive range of actions. To this end, a motion BLIP is trained upon a pretrained vision-language model, then we automatically generate diverse motion captions for the collected motion sequences. As a result, we finally build a dataset comprising 8,888 motions coupled with 141k text.To comprehensively understand the text command, we propose a Hierarchical Semantic Aggregation (HSA) module to capture the fine-grained semantics.Finally,we involve the above two designs into an effective Motion Discrete Diffusion (MDD) framework to strike a balance between motion quality and diversity. Extensive experiments on HumanML3D and KIT-ML show that our DiverseMotion achieves the state-of-the-art motion quality and competitive motion diversity. Dataset, code, and pretrained models will be released to reproduce all of our results.
研究の動機と目的
- 既存のテキストからモーション生成モデルにおける多様性の欠如に取り組むこと。これは、高品質ではあるが繰り返し的でテンプレートのようなモーションを生成する傾向があるためである。
- 現在のモーションベンチマークにおける行動カバレッジの制限を克服すること。これは、モデルが多様なモーションパターンを学習する能力を制限している。
- アクション動詞を超えた意味的差異を捉えることで、テキストプロンプトの意味理解を向上させること。特に、複雑または記述的なフレーズにおいて顕著な違いを捉えること。
- 事前学習済みのビジョン・ランゲージモデルを活用した、スケーラブルで自動化されたプロセスを用いて、多様で高品質なモーション・キャプションデータセットを構築すること。
- テキスト条件付きモーション生成における、モーション品質(FIDで測定)とモーション多様性(MM-Distで測定)のバランスの取れたトレードオフを達成すること。
提案手法
- 著者らは、既存のモーション・テキストペアを用いて、モーションBLIPを微調整することで、8,888本のモーションシーケンスに対して141万件の多様なキャプションを自動生成し、Wild Motion-Caption(WMC)データセットを構築した。
- CLIPベースのテキストエンコーダーから得られる複数レベルのテキスト埋め込みを統合することで、低レベルの詳細と高レベルの意味を統合する階層的意味統合(HSA)モジュールを提案した。
- VQ-VAEベースのモーショントークナイザーと離散拡散モデルを組み合わせたモーション離散拡散(MDD)フレームワークを構築した。このフレームワークでは、モーションシーケンスを離散トークンとしてモデル化することで、効率的な生成を実現した。
- 分類器フリーのガイドランスを推論時に用い、スケールハイパーパrameterを介して、モーション・テキストの整合性と生成多様性のトレードオフを制御した。
- MDDフレームワークは、HSAでエンコードされたテキスト埋め込みを条件として、正確で多様なモーション生成を可能にした。
- モデルはHumanML3DおよびKIT-MLで訓練・評価され、HSAおよび拡散ステップ設定に関する広範なアブレーションスタディが実施された。

実験結果
リサーチクエスチョン
- RQ1大規模かつ多様なモーション・キャプションデータセットは、テキストからモーション生成における生成モーションの多様性を顕著に向上させることができるか?
- RQ2階層的テキストエンコーディングは、アクション動詞を越えた自然言語プロンプトの微細な違いを理解する能力をどのように向上させるか?
- RQ3分類器フリーのガイドランスを用いた離散拡散モデリングは、テキスト条件付き生成におけるモーション品質と多様性のバランスをどの程度うまく調整できるか?
- RQ4標準的なテキストエンコーディングと比較して、HSAモジュールは長文または複雑なテキストプロンプトにおける性能を向上させるか?
- RQ5品質と多様性の最良のトレードオフを達成するための最適な拡散ステップ数は何か?
主な発見
- DiverseMotionは、HumanML3DベンチマークにおいてFID 0.070の新たな最先端水準を達成し、ベースライン比で48%の改善、先行SOTA手法比でも40%の改善を示した。
- HumanML3DではTop-1精度が0.496、Top-3精度が0.783を達成し、優れたモーション・テキスト整合性と生成多様性を示した。
- HSAモジュールは、標準的なCLIPトークン埋め込みを用いたベースラインと比較してFIDを48%改善した。特に長文・複雑なプロンプトでは、MM-Dist-Lの改善が0.057に達した。
- アブレーションスタディの結果、100ステップの拡散が品質と多様性のバランスにおいて最良の結果をもたらし、30ステップ(低すぎ)および120ステップ(高すぎ)の設定では性能が低下した。
- スケールs=100の分類器フリーのガイドランスを用いることで、望ましいトレードオフが達成された。テキスト・モーションの一貫性は実際のモーションを上回り(Top-1: 0.496 vs. 実際の0.511)、同時に高い多様性を維持した。
- 定性的な結果では、DiverseMotionは同じプロンプトに対し、複数の妥当で異なるモーションを生成するのに対し、先行SOTA手法は非常に類似した出力を生成する傾向にあった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。