Skip to main content
QUICK REVIEW

[論文レビュー] Feel The Music: Automatically Generating A Dance For An Input Song

Purva Tendulkar, Abhishek Das|arXiv (Cornell University)|Jun 21, 2020
Music and Audio Processing参考文献 15被引用数 5
ひとこと要約

本論文では、メル周波数 cepstral コEfficients (MFCCs) を用いて音楽セグメントの構造的類似性に一致するように、空間的・時間的動きのパターンを最適化することで、創造的で音楽に合わせたダンスを生成する機械学習的手法を提示する。この手法は、離散的な動きの状態とアクションの上でのグリーディ探索を用い、人間の評価において、その最良のバリアント(アクションベースの同期)が、強力なベースラインと比較して著しく創造的でインspiringで、同期性が高いと評価された。これは、多様な可視化形式や楽曲ジャンルにわたり同様に成り立つ。

ABSTRACT

We present a general computational approach that enables a machine to generate a dance for any input music. We encode intuitive, flexible heuristics for what a 'good' dance is: the structure of the dance should align with the structure of the music. This flexibility allows the agent to discover creative dances. Human studies show that participants find our dances to be more creative and inspiring compared to meaningful baselines. We also evaluate how perception of creativity changes based on different presentations of the dance. Our code is available at https://github.com/purvaten/feel-the-music.

研究の動機と目的

  • エキスパート監視データを一切用いずに、創造的で音楽に合わせたダンスを生成する計算フレームワークの開発。
  • 音楽の構造と動きのパターンの整合性を「良いダンス」としてモデル化し、厳密なルールではなく直感的なヒューリスティックを用いる。
  • 機械生成ダンスが、ベースライン手法と比較して、人間がより創造的でインスピレーションに満ちており、音楽と同期していると感じられるかどうかの評価。
  • 可視化形式がダンスの創造性および同期性の認識に与える影響を調査すること。
  • ステップ数および動き表現(状態対比 vs. アクション)がダンスの質および認識に果たす役割を探索すること。

提案手法

  • 音楽をメル周波数ケプストラム係数(MFCCs)で表現し、時間フレーム間の構造的類似性を捉えるために自己相関行列を計算する。
  • ダンスを離散的状態またはアクションの系列としてモデル化し、状態ベース(ST)、アクションベース(AC)、および状態とアクションの組み合わせ(SA)のバリエーションを含む動き表現を用いる。
  • 音楽の自己相関とダンスの動き類似性の類似度を最大化する整合性スコアを定義し、構造的対応を促進する。
  • 整合性スコアを最適化するためにグリーディ探索手順を用い、音楽構造に同期するダンスシーケンスを生成する。
  • アマゾンMechanical Turkを用いた研究を通じてダンスを評価し、参加者が4つの指標(創造性、同期性、予測不可能性、インスピレーション)についてダンスペアを比較する。
  • 可視化形式(例:スティックマン、脈動する円盤、1次元グリッド)とステップ数(25、50、100)を体系的に変化させ、それらが認識に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1エキスパートアノテートされたダンスデータが存在しない状況下でも、機械がベースライン手法よりも創造的でインスピレーションに満ちたダンスを生成できるか?
  • RQ2動き表現の選択(状態ベース対比 vs. アクションベース)が、ダンスの質および音楽との同期性の認識にどのように影響するか?
  • RQ3ダンスシーケンスのステップ数を増やすことで、創造性および同期性の認識が向上するか、それとも不快な「ジャンプiness」を引き起こすか?
  • RQ4異なる可視化形式(例:人間型スティックマン対幾何学的形状)が、ダンスの創造性および音楽との整合性の認識にどのように影響するか?
  • RQ5学習された整合性ヒューリスティックを用いた場合と、ランダムまたはビート同期ベースラインと比較して、ダンスの認識品質に顕著な差があるか?

主な発見

  • アクションベースの同期(AC)アプローチは、すべてのベースライン、特に強力なベースライン(UR)と比較して、著しく創造的であると評価され、99%信頼水準で人間比較において61%の勝率を記録した。
  • 100ステップのダンスは25または50ステップのダンスよりも創造的に感じられ、50ステップのダンスに対して69%の勝率、25ステップのダンスに対して73%の勝率を示した(99%信頼水準)。
  • URベースライン(構造のないランダムな動き)は、構造のあるベースライン(SS、US)よりも創造的でインスピレーションに満ちており、同期性が高いと評価された。これは、音楽特徴と整合するランダムな動きが、創造性としてより強く認識される可能性を示唆している。
  • 人間型スティックマンの可視化は、創造性の認識が最も高かった。ACアプローチはURを61%の割合で上回った(95%信頼水準)。これは、人間型のフォームが洗練されたダンス表現の認識を強化することを示している。
  • 7種類の可視化形式のうち、ACアプローチはURを5/7のケースで好まれ、そのうち3つの可視化形式でAC手法の好まれ方が統計的に有意(p > 0.95)であった。
  • 本手法は、すべてのベースラインと比較して、音楽との同期性の認識が高く、インスピレーションの観点でも優れており、特にアクションベースの動き表現を用いた場合に顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。