[論文レビュー] Dance2Music: Automatic Dance-driven Music Generation
本稿では、ダンスビデオから音楽を生成するDance2Musicというシステムを提案する。このシステムはオффラインの検索ベースのアプローチまたはオンラインのディープラーニングモデルのどちらかを用いる。強力なベースラインと比較して、人間の好みが顕著に高く、オフライン手法では77%、オンライン手法では70%の好みを得ており、ポーズと音符の相関最適化によってダンスの動きと音楽のノートが効果的に同期していることが示された。
Dance and music typically go hand in hand. The complexities in dance, music, and their synchronisation make them fascinating to study from a computational creativity perspective. While several works have looked at generating dance for a given music, automatically generating music for a given dance remains under-explored. This capability could have several creative expression and entertainment applications. We present some early explorations in this direction. We present a search-based offline approach that generates music after processing the entire dance video and an online approach that uses a deep neural network to generate music on-the-fly as the video proceeds. We compare these approaches to a strong heuristic baseline via human studies and present our findings. We have integrated our online approach in a live demo! A video of the demo can be found here: https://sites.google.com/view/dance2music/live-demo.
研究の動機と目的
- ダンスからの自動音楽生成を探索する。これは音楽からダンスへの生成と比較して、まだ十分に研究が進んでいない分野である。
- ダンスの感情的・リズミカルな流れと同期していると感じられる音楽を生成するシステムを開発する。
- 人間評価を用いて、ダンスビデオからの音楽生成におけるオフラインとオンラインアプローチを比較する。
- ライブダンス入力からリアルタイムで音楽を生成するライブデモを構築する。
- 人間評価における比較のための強力なヒューリスティックベースラインを確立する。
提案手法
- OpenPoseを用いて抽出した18キーポイントの2次元ポーズの系列としてダンスを表現し、各フレームを36次元のベクトルに正規化する。
- Cメジャー・パentaトニックスケール(C4, D4, E4, G4, A4)の音符として音楽を表現することで、協和性と認識のしやすさを確保する。
- 局所的な時間窓内でポーズ類似度と音符類似度のピアソン相関を最大化する検索ベースのオフラインアプローチを用いる。
- オフラインアプローチの相関最適化を模倣するオンラインのディープニューラルネットワークを実装し、ライブビデオからのリアルタイム音楽生成を可能にする。
- ビームサーチを用い、ビームサイズBを設定し、局所的およびグローバルなポーズ類似度履歴を用いてノート系列の選択をガイドする。
- 455本のAISTデータセット動画でオンラインモデルを学習し、45本の動画で評価した。その結果、73.5%の正確度とオフラインアプローチとの平均相関0.33を達成した。
実験結果
リサーチクエスチョン
- RQ1検索ベースのオフライン手法は、強力なヒューリスティックベースラインと比較して、ダンスとより同期的だと感じられる音楽を生成できるか?
- RQ2オフライン手法を模倣するように学習されたディープラーニングモデルは、リアルタイムで即座に音楽を生成でき、人間の同期感覚と一致するか?
- RQ3局所的ポーズ履歴とグローバルなポーズ履歴の使用が、音楽のダイナミクスと評価された品質に与える影響は何か?
- RQ4オンラインニューラルネットワークとオフライン検索ベースのアプローチとの間で、ノート予測の正確度とダンスの動きとの相関において、性能の差は何か?
- RQ5ダンスの動きから生成された音楽は、人間評価においてベースライン音楽と比較して統計的に有意に好まれるか?
主な発見
- オフライン手法は人間評価において77%の勝率を記録し、ポーズ類似度と音符類似度の相関を最適化した音楽が統計的に有意に好まれることを示した。
- オンラインディープラーニング手法は人間評価で70%の勝率を記録し、これも統計的に有意であり、強力なリアルタイム性能を示した。
- オンラインモデルは、オフライン手法と比較して、次のノートを予測する際のテスト正確度が73.5%に達した。これは20%の確率ベースラインを著しく上回っている。
- オンラインモデルの生成されたノート系列とダンスポーズ系列との平均ピアソン相関は0.33であり、オフライン手法は0.38であった。両者とも最適化の目的関数と強い一致を示した。
- オフライン手法で局所的履歴を使用した場合、グローバル履歴よりもダイナミックな音楽が得られ、グローバル履歴では平坦なノート系列が生じた。
- オンライン手法のライブデモは、ライブビデオ入力からリアルタイムで音楽を生成することに成功し、システムの実用的導入可能性を検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。