Skip to main content
QUICK REVIEW

[論文レビュー] EDGE: Editable Dance Generation From Music

Jonathan Tseng, Rodrigo Castellon|arXiv (Cornell University)|Nov 19, 2022
Music Technology and Sound Studies被引用数 4
ひとこと要約

EDGEは、音楽に同期した編集可能で物理的に妥当なダンス動作を生成する拡散モデルであり、Jukeboxによる音声特徴の活用とトランスフォーマー構造により、関節単位の条件付けと補間を可能にしている。物理的足接触スコアの新規導入により最先端の性能を達成し、先行手法と比較して優れた品質がユーザースタディで検証された。

ABSTRACT

Dance is an important human art form, but creating new dances can be difficult and time-consuming. In this work, we introduce Editable Dance GEneration (EDGE), a state-of-the-art method for editable dance generation that is capable of creating realistic, physically-plausible dances while remaining faithful to the input music. EDGE uses a transformer-based diffusion model paired with Jukebox, a strong music feature extractor, and confers powerful editing capabilities well-suited to dance, including joint-wise conditioning, and in-betweening. We introduce a new metric for physical plausibility, and evaluate dance quality generated by our method extensively through (1) multiple quantitative metrics on physical plausibility, beat alignment, and diversity benchmarks, and more importantly, (2) a large-scale user study, demonstrating a significant improvement over previous state-of-the-art methods. Qualitative samples from our model can be found at our website.

研究の動機と目的

  • 音楽に同期し、物理的に妥当で、長時間にわたるリアリスティックなダンス動作を生成する手法を開発すること。
  • 従来の評価指標の限界を克服し、物理的根拠に基づいた足接触の一貫性を測る新しい指標を提案すること。
  • 統合的な生成フレームワーク内で、関節単位の条件付けや補間といった強力な編集機能を実現すること。
  • 定量的指標と大規模な人間評価の両面から、先行する最先端手法を上回るダンス生成品質を向上させること。

提案手法

  • 音楽埋め込みを条件として、ランダムノイズから潜在的ダンスシーケンスをノイズ除去するトランスフォーマー基盤の拡散モデルを訓練する。
  • 事前学習済みの音楽生成モデルJukeboxが、拡散プロセスのクロスアテンションコンテキストとして高レベルな音声表現を提供する。
  • 時間ステップにわたる一貫性のある足接触行動を強制することで、足のスライドを低減するための新しい接触一貫性損失を導入する。
  • 物理的インスピレーションを受けて加速度に基づく指標として、物理的シミュレーションを明示的に必要としない物理的妥当性を評価するための「物理的足接触スコア」(PFC)を提案する。
  • 関節単位の条件付けや補間を通じて、ユーザー指定の運動制約を可能にする編集可能な生成をサポートする。
  • 局所的に一貫性のある短いクリップを連結することで、任意長の出力を実現する長時間シーケンスの生成
Figure 2 : EDGE Pipeline Overview: EDGE learns to denoise dance sequences from time $t=T$ to $t=0$ , conditioned on music. Music embedding information is provided by a frozen Jukebox model [ 5 ] and acts as cross-attention context. EDGE takes a noisy sequence $\bm{z}_{T}\sim\mathcal{N}(0,\bm{I})$ an
Figure 2 : EDGE Pipeline Overview: EDGE learns to denoise dance sequences from time $t=T$ to $t=0$ , conditioned on music. Music embedding information is provided by a frozen Jukebox model [ 5 ] and acts as cross-attention context. EDGE takes a noisy sequence $\bm{z}_{T}\sim\mathcal{N}(0,\bm{I})$ an

実験結果

リサーチクエスチョン

  • RQ1拡散ベースのモデルは、編集可能で物理的に妥当かつ音楽に同期した長時間のダンスシーケンスを生成できるか?
  • RQ2従来の自動評価指標は、人間による評価と一致するダンス生成品質を正確に反映しているか?
  • RQ3物理的シミュレーションを明示的に必要としない学習済み指標(PFC)は、物理的妥当性を運動学的運動に効果的に捉えられるか?
  • RQ4手作業で設計された音声特徴と比較して、Jukebox特徴の統合はダンス生成品質をどのように向上させるか?
  • RQ5関節単位の条件付けや補間といった編集機能は、ユーザーの制御力と運動品質をどの程度向上させるか?

主な発見

  • EDGEはAIST++データセットで最先端の性能を達成し、ユーザースタディにおいて先行手法を顕著に上回った。
  • 物理的足接触スコア(PFC)は、物理的シミュレーションを必要とせず、足のスライドを効果的に特定・ペナルティ化し、物理的妥当性を向上させた。
  • ユーザースタディの結果、EDGEが生成したダンスは、先行する最先端モデルと比較してよりリアリスティックで音楽に整合していると評価された。
  • 従来の研究で用いられたビート同期度指標は、ダブルタイムやハーフタイムの振り付けなど、有効な非ビート同期運動を誤ってペナルティ処理するという欠陥が判明した。
  • PFC指標は、従来のFIDスタイルの指標よりも人間評価と相関が高く、運動生成において信頼性が低いことが示された。
  • EDGEは、関節単位の条件付けや補間を含む柔軟な編集をサポートしており、生成されたダンスシーケンスに対する正確なユーザー制御を可能にした。
Figure 3 : Although EDGE is trained on 5-second clips, it can generate choreographies of any length by imposing temporal constraints on batches of sequences. In this example, EDGE constrains the first 2.5 seconds of each sequence to match the last 2.5 seconds of the previous one to generate a 12.5-s
Figure 3 : Although EDGE is trained on 5-second clips, it can generate choreographies of any length by imposing temporal constraints on batches of sequences. In this example, EDGE constrains the first 2.5 seconds of each sequence to match the last 2.5 seconds of the previous one to generate a 12.5-s

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。