Skip to main content
QUICK REVIEW

[論文レビュー] Motion Flow Matching for Human Motion Synthesis and Editing

Vincent Tao Hu, Wenzhe Yin|arXiv (Cornell University)|Dec 14, 2023
Human Motion and Animation被引用数 4
ひとこと要約

本稿では、10ステップのサンプリングのみで、従来の拡散モデルと比較して著しく推論時間を短縮した、人間の動き生成のための新しい生成モデルであるMotion Flow Matchingを紹介する。このモデルは、サンプリング軌道の再書き換えによるトレーニングフリーな動き編集を可能にし、ODEベースのフローマッチングを用いることで直線的な生成軌道を確保する。これにより、高速かつ高精度な動き生成と、補間、予測、上半身の操作といった多様なタスクにおける一貫性のある編集が実現される。

ABSTRACT

Human motion synthesis is a fundamental task in computer animation. Recent methods based on diffusion models or GPT structure demonstrate commendable performance but exhibit drawbacks in terms of slow sampling speeds and error accumulation. In this paper, we propose \emph{Motion Flow Matching}, a novel generative model designed for human motion generation featuring efficient sampling and effectiveness in motion editing applications. Our method reduces the sampling complexity from thousand steps in previous diffusion models to just ten steps, while achieving comparable performance in text-to-motion and action-to-motion generation benchmarks. Noticeably, our approach establishes a new state-of-the-art Fréchet Inception Distance on the KIT-ML dataset. What is more, we tailor a straightforward motion editing paradigm named \emph{sampling trajectory rewriting} leveraging the ODE-style generative models and apply it to various editing scenarios including motion prediction, motion in-between prediction, motion interpolation, and upper-body editing. Our code will be released.

研究の動機と目的

  • 拡散ベースの動き生成モデルが通常1000ステップ以上を要するため、そのサンプリング速度の遅さを解消すること。
  • 微調整や追加のトレーニングを必要とせず、制御性と編集可能性を向上させること。
  • 他のモodalitiyで用いられているフローマッチング技術を、初めて人間の動き生成に応用すること。
  • フローマッチングモデルの直線的軌道の性質を活用し、実時間での実用的かつ高速な動き編集を可能にすること。
  • 最小限のサンプリングステップで、KIT-MLデータセットにおいてFréchet Inception Distance (FID) の新しいSOTAを確立すること。

提案手法

  • ODEソルバを用いて線形補間されたベクトル場を回帰するように学習する、フローマッチングに基づく生成モデルを提案。
  • 変換器ベースのアーキテクチャを用いて動きの系列をモデル化し、効率的かつスケーラブルな生成を実現。
  • サンプリング軌道の再書き換え:既知の動きセグメントをODE軌道に一致させることで、一貫性のある編集済みの動きを生成する、トレーニングフリーな編集手法。
  • ノイズからデータへ動きを生成する際、直線的なパスに従うことで、安定性と高速収束を確保するODEソルバを適用。
  • 既知の時刻(例:t=0.2)以降のサンプリング軌道を再書き換えることで、入力の動きセグメントと整合性を保ちながら編集を実行。
  • 関節空間でのインpaintingを実施し、他の部位に影響を与えることなく特定の身体部位の意味的編集を可能にする。

実験結果

リサーチクエスチョン

  • RQ1フローマッチングを人間の動き生成に効果的に適用することで、拡散モデルと比較して著しく少ないサンプリングステップで高品質な結果を得られるか?
  • RQ2フローマッチングの直線的軌道の性質を活用し、効率的かつトレーニングフリーな動き編集を実現できるか?
  • RQ3サンプリング軌道の再書き換えが、補間や将来予測のような部分的なシーケンスの編集においても動きの一貫性を維持できるか?
  • RQ4提案手法は、標準ベンチマークにおいて、生成品質と推論速度の両面で既存の拡散ベースモデルを上回るか?
  • RQ5上半身の操作や動き補間を含む多様な編集シナリオに一般化可能であり、意味的整合性を保っているか?

主な発見

  • 提案されたMotion Flow Matchingモデルは、KIT-MLデータセットにおいて15.4のFréchet Inception Distance (FID) を達成し、既存手法を上回る新しいSOTAを樹立した。
  • 拡散モデルが通常必要とする約1000ステップから、本手法ではわずか10ステップに削減され、V100 GPU上でのMMDと比較して100倍、MLDと比較して5倍の高速化が達成された。
  • HumanML3Dテストセットでは1動画あたり平均0.11秒の推論時間で、実時間実行の可能性を示した。
  • サンプリング軌道の再書き換えにより、補間、将来予測、上半身編集、補間といった複数のシナリオで一貫性のある編集が可能であり、MDMと比較してFID、ADE、FDEにわずかな改善が見られた。
  • 初期時刻(例:t=0.2)でも、プロンプトと密接に一致する比較的正確な動き推定が得られ、直線的軌道の安定性を示した。
  • 関連する関数評価回数を大幅に削減しながらも、テキストから動き、アクションから動きへの生成において、ベースラインと同等または優れた結果を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。