Skip to main content
QUICK REVIEW

[論文レビュー] Towards Movement Generation with Audio Features

Benedikte Wallace, Charles Martín|arXiv (Cornell University)|Nov 26, 2020
Music and Audio Processing参考文献 14被引用数 4
ひとこと要約

本論文では、脈打つリズムの明瞭さや帯域ごとのスペクトルフラックスといった高レベルの音声特徴に条件づけられた現実的なダンス動作を生成する生成的Mixture Density Recurrent Neural Network(MDRNN)を提案する。結果は、音声入力に応じて意味的に変化する運動シーケンスを生成することを示しており、音声と運動の間の学習済みのクロスモodalな依存関係を裏付けている。

ABSTRACT

Sound and movement are closely coupled, particularly in dance. Certain audio features have been found to affect the way we move to music. Is this relationship between sound and movement something which can be modelled using machine learning? This work presents initial experiments wherein high-level audio features calculated from a set of music pieces are included in a movement generation model trained on motion capture recordings of improvised dance. Our results indicate that the model learns to generate realistic dance movements which vary depending on the audio features.

研究の動機と目的

  • 機械学習が音声特徴と人間のダンス動作の関係をモデル化できるかどうかを調査すること。
  • 音声特徴に条件づけられた現実的で多様なダンス動作を生成する生成的モデルを開発すること。
  • 特定の音声特徴—脈打つリズムの明瞭さと帯域ごとのスペクトルフラックス—が運動生成にどのように影響するかを検討すること。
  • 訓練データに含まれない音声入力に対しても、モデルが運動の現実性を保ちながら一般化できるかを評価すること。

提案手法

  • 54本の1分間の運動キャプチャ記録(30Hz)を用いて、22個のボディポイントを3次元空間で表現したMDRNNを訓練する。
  • 脈打つリズムの明瞭さと帯域スペクトルフラックス(50–100 Hzおよび3200–6400 Hz帯域)という音声特徴を、5秒のスライディングウィンドウ(0.08秒のオフセット)を用いて抽出し、運動フレームに同期させる。
  • モデルはシーケンス・ツー・シーケンスのマッピングを実行する:現在の運動ポーズと音声特徴を入力として、次のポーズを予測する。出力には音声を含めない。
  • データは最小-最大正規化、スプライン補間、2次バターワーストフィルタを用いて前処理され、ジターリダクションとスケール・ポジション不変性を確保する。
  • 音声の影響を評価するためにプリミング技術を用いる:モデルは参照運動シーケンスに条件づけられながら、音声入力を変更することで感度をテストする。
  • モデルはAdam最適化アルゴリズムを用いて訓練され、バリデーション損失に基づく早期停止が適用され、確率的密度推定にはKeras-MDNレイヤーが使用される。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、音声特徴に応じて変化する現実的なダンス動作を学習して生成できるか?
  • RQ2訓練中に見られなかった音楽の音声特徴に対して、モデルはどの程度一般化できるか?
  • RQ3脈打つリズムの明瞭さと帯域スペクトルフラックスといった特定の音声特徴が、生成された運動のスタイルと安定性にどのように影響するか?
  • RQ4モデルはフレーム単位の滑らかで現実的な運動を生成するために、構造的な音声入力を必要としているか?

主な発見

  • MDRNNは音声入力がなくても現実的なダンス動作を生成できており、運動ダイナミクスの強力なモデリングを示している。
  • 訓練データ内の音声特徴に条件づけられた場合、モデルはプリミング例に類似した運動シーケンスを生成するが、表現力は低下する。
  • 訓練データに含まれない新しい楽曲の音声特徴に条件づけられた場合、モデルは妥当な運動を生成するが、ジターリングが増加する傾向にあり、部分的な一般化が示唆される。
  • 音声特徴をホワイトノイズに置き換えた場合、生成される運動は著しくジターリングするため、滑らかな運動生成には構造的な音声入力に依存していることが示された。
  • モデルは学習済みのクロスモーダル依存関係を示している:異なる音声特徴が異なる運動パターンをもたらし、音声が運動生成を形作っていることが確認された。
  • すべての音声条件において、モデルは妥当なポーズ予測を維持しており、音声の変化に対しても運動予測の堅牢性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。