Skip to main content
QUICK REVIEW

[論文レビュー] DanceNet3D: Music Based Dance Generation with Parametric Motion Transformer.

Buyu Li, Yongchi Zhao|arXiv (Cornell University)|Mar 18, 2021
Human Motion and Animation参考文献 21被引用数 12
ひとこと要約

DanceNet3Dは、ビートに同期したキーポーズの間の補間運動曲線としてダンスモーションを定式化する、新しい3次元ダンス生成フレームワークを提案する。MoTransに基づくTransformerに運動学的制約と局所的時系列注意を組み合わせ、滑らかでビートに同期し、パフォーマンス的な3次元ダンスを生成する。本研究は、新規のPhantomDanceデータセットにおいて、定量的・定性的に先行研究を上回る結果を達成した。

ABSTRACT

In this work, we propose a novel deep learning framework that can generate a vivid dance from a whole piece of music. In contrast to previous works that define the problem as generation of frames of motion state parameters, we formulate the task as a prediction of motion curves between key poses, which is inspired by the animation industry practice. The proposed framework, named DanceNet3D, first generates key poses on beats of the given music and then predicts the in-between motion curves. DanceNet3D adopts the encoder-decoder architecture and the adversarial schemes for training. The decoders in DanceNet3D are constructed on MoTrans, a transformer tailored for motion generation. In MoTrans we introduce the kinematic correlation by the Kinematic Chain Networks, and we also propose the Learned Local Attention module to take the temporal local correlation of human motion into consideration. Furthermore, we propose PhantomDance, the first large-scale dance dataset produced by professional animatiors, with accurate synchronization with music. Extensive experiments demonstrate that the proposed approach can generate fluent, elegant, performative and beat-synchronized 3D dances, which significantly surpasses previous works quantitatively and qualitatively.

研究の動機と目的

  • 従来の方法がダンスを離散的なモーションフレームとして生成するという制限を克服し、キーポーズ間の連続的な運動曲線としてモーションをモデル化すること。
  • 運動固有の注意メカニズムを用いて、3次元ダンス生成における時間的整合性と運動学的妥当性を向上させること。
  • 音楽に同期した大規模かつプロフェッショナルがアノテートした3次元ダンスデータセットを構築し、学習と評価を支援すること。
  • より滑らかで洗練され、パフォーマンス的な3次元ダンスアニメーションを、音楽のビートに正確に同期させること。

提案手法

  • DanceNet3Dは、音楽から3次元ダンスシーケンスを生成するために、敵対的学習を用いたエンコーダ・デコーダアーキテクチャを採用する。
  • まず、モーションに注意を払うエンコーダを用いて、音楽のビートに合わせてキーポーズを予測する。
  • デコーダは、関節の依存関係をモデル化するための運動学的チェーンネットワークを組み込んだ、運動固有のTransformer(MoTrans)を採用する。
  • 学習された局所的注意モジュールは、人間のモーションシーケンスにおける短時間スケールの時系列相関を捉える。
  • キーポーズ間の運動曲線は、微分可能補間スキームを用いて連続的な3次元軌道として予測される。
  • 本フレームワークは、プロのアニメーターが正確な音楽同期を意識して作成した新規のPhantomDanceデータセットで学習される。

実験結果

リサーチクエスチョン

  • RQ1キーポーズ間の連続的な曲線としてモーションをモデル化することで、フレームごとの生成と比較して、3次元ダンス生成の滑らかさと自然さが向上するか?
  • RQ2運動学的チェーン制約と局所的時系列注意の統合は、モーションの妥当性と時間的整合性をどの程度向上させるか?
  • RQ3音楽に同期した大規模かつプロフェッショナルがアノテートした3次元ダンスデータセットは、生成品質にどの程度寄与するか?
  • RQ4提案されたMoTransアーキテクチャは、複雑でパフォーマンス的なダンスモーションの生成において、標準的なTransformerを上回るか?

主な発見

  • 定量的指標と定性的分析の両面から検証された結果、DanceNet3Dは、以前の手法と比較して顕著に滑らかで時間的整合性の高い3次元ダンスを生成する。
  • モデルは、ビート同期性において優れた性能を示し、モーションが正確に音楽のダウンビートに一致している。
  • 運動学的チェーンネットワークと学習された局所的注意の導入により、モーションの妥当性が向上し、不自然な関節の動きが減少した。
  • PhantomDanceデータセットのおかげで、よりリアルで多様なダンス生成が可能となり、プロレベルのモーション品質と正確な音楽アラインメントを実現した。
  • 定量的評価では、FIDやモーションの滑らかさといった指標において、最先端のベースラインを一貫して上回る結果が得られた。
  • 定性的な結果から、生成されたダンスが洗練されており、パフォーマンス的で、芸術的・エンターテインメント用途に適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。