Skip to main content
QUICK REVIEW

[論文レビュー] MoFusion: A Framework for Denoising-Diffusion-based Motion Synthesis

Rishabh Dabral, M. Hamza Mughal|arXiv (Cornell University)|Dec 8, 2022
Human Motion and Animation被引用数 5
ひとこと要約

MoFusionは、テキストおよび音声条件付きの3D人体運動生成に、最初のノイズ除去拡散モデルベースのフレームワークを導入し、高品質で多様性に富み、時間的に整合性のある運動生成を可能にした。運動の自然さと意味的正確性の両面で優れた性能を達成するため、運動の可動性制約を統合した時間依存の損失重み付け戦略を採用しており、テキストから運動への変換および音楽から振付への変換の両タスクで最先端の性能を発揮している。

ABSTRACT

Conventional methods for human motion synthesis are either deterministic or struggle with the trade-off between motion diversity and motion quality. In response to these limitations, we introduce MoFusion, i.e., a new denoising-diffusion-based framework for high-quality conditional human motion synthesis that can generate long, temporally plausible, and semantically accurate motions based on a range of conditioning contexts (such as music and text). We also present ways to introduce well-known kinematic losses for motion plausibility within the motion diffusion framework through our scheduled weighting strategy. The learned latent space can be used for several interactive motion editing applications -- like inbetweening, seed conditioning, and text-based editing -- thus, providing crucial abilities for virtual character animation and robotics. Through comprehensive quantitative evaluations and a perceptual user study, we demonstrate the effectiveness of MoFusion compared to the state of the art on established benchmarks in the literature. We urge the reader to watch our supplementary video and visit https://vcai.mpi-inf.mpg.de/projects/MoFusion.

研究の動機と目的

  • 条件付き3D人体運動生成における運動の多様性と品質のトレードオフを解消すること。
  • GANにおけるモード崩壊やVAEにおける潜在空間のトレードオフといった従来手法の限界を克服すること。
  • テキストや音楽といった多様な入力条件下で、長時間にわたる時間的に整合性があり意味的に整合する運動シーケンスの生成を可能にすること。
  • バーチャルアニメーションやロボット工学における実用的応用を想定し、中間挿入やシード条件付き予測といったインタラクティブ編集機能を導入すること。
  • 特に、訓練分布外の音声入力に対する音楽条件付き振付生成においても、一般化性能を向上させること。

提案手法

  • 非自己回帰的3D運動生成のため、ノイズ除去拡散確率的モデル(DDPM)を採用し、効率的な逆ノイズ除去を実現するための軽量な1D U-Netを用いる。
  • 訓練中に複数の可動性損失を動的にバランスさせる時間依存の損失重み付けスケジュールを導入し、運動の整合性と時間的整合性を向上させる。
  • クロスアテンション機構を介してテキストまたは音声埋め込みを条件付けとして用いることで、マルチモーダル制御による運動生成を実現する。
  • 構造的一致性を保つために、予測や中間挿入の際、シードシーケンスを保持するマスク付きノイズ除去プロセスを採用する。
  • コードブックベースの手法と比較して、多様なサンプリングと運動のちらつきに対する耐性を高めるために、学習された潜在空間を運動表現に用いる。
  • 訓練中にランダムノイズから段階的にノイズ除去を行うノイズスケジュールを適用し、条件付け信号と可動性制約に従ってガイドする。

実験結果

リサーチクエスチョン

  • RQ1長時間シーケンスを対象とした条件下3D人体運動生成に、ノイズ除去拡散モデルを効果的に適用できるか?
  • RQ2多様性や品質を損なわせることなく、可動性の整合性を拡散学習プロセスに統合する方法は何か?
  • RQ3MoFusionは、訓練データにない音楽やテキストプロンプトに対しても一般化できるか?
  • RQ4提案された時間依存の損失重み付け戦略は、固定重みベースラインと比較して、運動の自然さと意味的整合性をどのように向上させるか?
  • RQ5MoFusionは、中間挿入やシード条件付き運動予測といったインタラクティブ編集タスクをどの程度効果的にサポートできるか?

主な発見

  • MoFusionは、HumanML3DおよびAIST++ベンチマークで最先端の性能を達成し、FIDが8.82、FVDが2.521と、T2M や MotionDiffuse といった先行手法を上回った。
  • ユーザースタディにおいて、MoFusionは51.4%の比較で実際の振付よりも自然さが高く評価され、T2M や MotionDiffuse よりも52.3%の比較で意味的正確性が優れていた。
  • 訓練データ外の音楽に対しても、繰り返しのないリズムに整合した振付を生成するなど、一般化性能に優れている。
  • 大規模な潜在空間と非自己回帰的生成のおかげで、平均ポーズへの収束を回避し、運動のちらつきも解消された。
  • マスク付きノイズ除去により、シード条件付き予測や中間挿入といったインタラクティブ編集タスクが成功裏に実現され、アニメーションやロボット工学分野での実用的価値を示した。
  • 時間依存の損失重み付け戦略は、固定重みベースラインと比較して、運動の整合性を顕著に向上させ、時間的整合性と可動性の正確性を高めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。