Skip to main content
QUICK REVIEW

[論文レビュー] Towards 3D Dance Motion Synthesis and Control

Wenlin Zhuang, Yangang Wang|arXiv (Cornell University)|Jun 10, 2020
Human Motion and Animation参考文献 32被引用数 15
ひとこと要約

本論文では、1次元のダンスメロディラインを制御信号として用いることで、現実的で多様かつ制御可能な3Dダンスモーションを合成する新しいTC-LSTM生成モデルを提案する。モデルは時系列畳み込みエンコーダとLSTMデコーダを組み合わせ、長距離の空間時間的依存関係を捉え、ランダム合成、音楽からダンス、ユーザー制御ダンス生成の分野で、優れたメロディー整合性と多様性を実現し、最先端の性能を達成している。

ABSTRACT

3D human dance motion is a cooperative and elegant social movement. Unlike regular simple locomotion, it is challenging to synthesize artistic dance motions due to the irregularity, kinematic complexity and diversity. It requires the synthesized dance is realistic, diverse and controllable. In this paper, we propose a novel generative motion model based on temporal convolution and LSTM,TC-LSTM, to synthesize realistic and diverse dance motion. We introduce a unique control signal, dance melody line, to heighten controllability. Hence, our model, and its switch for control signals, promote a variety of applications: random dance synthesis, music-to-dance, user control, and more. Our experiments demonstrate that our model can synthesize artistic dance motion in various dance types. Compared with existing methods, our method achieved start-of-the-art results.

研究の動機と目的

  • 高運動学的複雑性と不規則性を示す3Dダンスモーションを現実的で多様かつ制御可能に合成するという課題に対処すること。
  • 多様なダンスタイプや複雑なモーショントポロジーを扱う際に、強い制御性に欠ける既存手法の限界を克服すること。
  • 一貫したフレームワーク内で、ランダム合成、音楽からダンス、ユーザー制御ダンス生成の複数の応用をサポートすること。
  • モード崩壊を防ぎ、制御性を向上させるために、新たな1次元制御信号「ダンスメロディライン」を導入すること。
  • 異なるダンススタイルにおいて、モーションの現実性、多様性、メロディー整合性の面で最先端の結果を達成すること。

提案手法

  • TC-LSTMモデルは、3Dモーションシーケンスからの空間時間的特徴を抽出するために、時系列畳み込みニューラルネットワーク(TCN)をエンコーダとして使用する。
  • LSTMベースのデコーダが自己回帰的に将来のモーションフレームを生成し、ダンスモーションにおける長期依存関係をモデル化する。
  • 音楽またはユーザーが描いた入力から、新たな1次元ダンスメロディラインを抽出し、学習時および推論時における制御信号として用いる。
  • 学習時、メロディラインはモーション生成をガイドする条件付き信号として使用される;推論時、メロディー整合性のあるダンス出力を保証する。
  • 再構成損失と adversarial 損失の組み合わせにより学習することで、現実性と多様性が向上する。
  • 音楽からダンスやユーザーが描いたメロディベースの制御を含む、エンドツーエンドの合成をサポートするフレームワーク。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、高い運動学的複雑性を持つ多様で現実的な3Dダンスモーションを効果的に合成できるか?
  • RQ21次元メロディラインは、音楽に整合したダンスモーションを生成する強力で効果的な制御信号として機能できるか?
  • RQ3同じモデルが、アーキテクチャの変更なしに、ランダム合成、音楽からダンス、ユーザー制御ダンス生成の複数の応用をサポートできるか?
  • RQ4提案されたTC-LSTMモデルは、現実性、多様性、制御性の面で、既存手法をどの程度上回るか?
  • RQ5なぜモデルはモダンダンスでは優れた性能を発揮するが、高速な韓国ダンスでは劣るのか?この問題はどのように改善できるか?

主な発見

  • TC-LSTMモデルは、3Dダンスモーション合成分野で最先端の性能を達成し、先行研究を上回る現実性と多様性を実現した。
  • デコーダにLSTMを組み込むことで、FIDスコアの顕著な低下が確認され、モーションの現実性が著しく向上した。
  • 特に、時間的滑らかさが高く、動的複雑性が低いモダンダンスにおいて、異なるダンスタイプにおいても高いメロディー整合性を維持した。
  • ユーザー評価では、マウス入力によるメロディラインの描画により、強いメロディー整合性を持つ現実的なダンスが生成されることを確認した。
  • メロディラインによる強力な監視のおかげで、学習中にモード崩壊が防止され、同じ初期条件でも多様な出力が得られた。
  • 音声フォーマット(WAVやMIDIを含む)にかかわらず、メロディラインを1次元時系列として抽出することで、さまざまな形式に一般化可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。