Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Deep Recurrent Neural Networks for Basic Dance Step Generation

Nelson Yalta, Shinji Watanabe|arXiv (Cornell University)|Jul 3, 2018
Human Motion and Animation参考文献 24被引用数 7
ひとこと要約

本論文では、音声のパワースペクトルを入力として用い、音楽に同期した基本的なダンスステップを生成する弱教師付きの深層再帰ニューラルネットワークを提案する。マルチレイヤードLSTMを用い、自己条件付きデコードと対照的損失関数によるビート同期化を実装することで、低交差エントロピー(1.41)と人間ダンサーよりも同等のFスコアを達成し、手作業で作成されたデータを最小限に抑えながらリアルタイムでエンドツーエンドの学習が可能である。

ABSTRACT

Synthesizing human's movements such as dancing is a flourishing research field which has several applications in computer graphics. Recent studies have demonstrated the advantages of deep neural networks (DNNs) for achieving remarkable performance in motion and music tasks with little effort for feature pre-processing. However, applying DNNs for generating dance to a piece of music is nevertheless challenging, because of 1) DNNs need to generate large sequences while mapping the music input, 2) the DNN needs to constraint the motion beat to the music, and 3) DNNs require a considerable amount of hand-crafted data. In this study, we propose a weakly supervised deep recurrent method for real-time basic dance generation with audio power spectrum as input. The proposed model employs convolutional layers and a multilayered Long Short-Term memory (LSTM) to process the audio input. Then, another deep LSTM layer decodes the target dance sequence. Notably, this end-to-end approach has 1) an auto-conditioned decode configuration that reduces accumulation of feedback error of large dance sequence, 2) uses a contrastive cost function to regulate the mapping between the music and motion beat, and 3) trains with weak labels generated from the motion beat, reducing the amount of hand-crafted data. We evaluate the proposed network based on i) the similarities between generated and the baseline dancer motion with a cross entropy measure for large dance sequences, and ii) accurate timing between the music and motion beat with an F-measure. Experimental results revealed that, after training using a small dataset, the model generates basic dance steps with low cross entropy and maintains an F-measure score similar to that of a baseline dancer.

研究の動機と目的

  • 最小限のラベル付きデータを用いて、長時間にわたるビートに同期したダンスシーケンスを生成するという課題に取り組む。
  • 動きの方向変化から得られる弱ラベルを活用することで、高価な手作業によるモーショングラフのアノテーションに依存するのを減らす。
  • 連続する音声フレームからビートタイミングを学習する対照的コスト関数を用いて、音楽と動きのビートの同期を改善する。
  • 生の音声入力からエンドツーエンドで学習可能であり、低遅延(約12 ms)の推論を実現するリアルタイムのダンス生成を可能にする。
  • 限られた訓練データで、音声のノイズに強く、多様な音楽ジャンルに一般化できる性能を示す。

提案手法

  • 2本のブランチ構造を採用:周波数の変動を低減するための畳み込み層、その後に時間的音声特徴を符号化するマルチレイヤードLSTM。
  • 自身の出力をフィードバックすることで、長時間にわたるダンスシーケンスを生成する自己条件付きデコードLSTMを採用し、誤差の蓄積を最小限に抑える。
  • 非ビートフレーム間の距離を最大化し、ビートフレーム間の距離を最小化することで、音楽と動きのビート同期を制御する対照的損失関数を適用。
  • 明示的なビートアノテーションを必要とせず、動きの方向変化から弱ラベルを生成する。
  • 音声入力と弱ラベル付きのモーショングラフビートのみを用いて、事前学習なしにエンドツーエンドでモデルを学習する。
  • 訓練中に、モーショングラフの類似度(交差エントロピーによる)とビートタイミングの正確さ(Fスコアによる)の両方を最適化する。
Figure 1: Framework.
Figure 1: Framework.

実験結果

リサーチクエスチョン

  • RQ1音声パワースペクトルと動きの方向変化という弱ラベルのみを用いて、弱教師付きの深層再帰モデルが現実的でビートに同期したダンスステップを生成できるか?
  • RQ2自己条件付きLSTMデコーダーは、ダンスモーショングラフの長時間にわたる生成における誤差蓄積をどの程度軽減できるか?
  • RQ3標準的な平均二乗誤差と比較して、対照的損失関数は音楽ビートと動きのビートの同期をどの程度改善するか?
  • RQ4限られた訓練データで、多様な音楽ジャンルとノイズのある音声入力に対して、モデルはどの程度の性能を示すか?
  • RQ5高精度なモーショングラフ類似度とビート正確さを維持しながら、リアルタイム推論性能を達成できるか?

主な発見

  • S2S-MCモデルはサンバデータセットでFスコア53.96、ヒップホップデータセットで53.79を達成し、クリーンな条件下でベースラインダンサー(それぞれ52.82および62.31)を上回った。
  • バウンスデータセットでは、S2S-MCモデルの交差エントロピーが1.41にまで低下し、S2S(1.98)を顕著に下回った。これは、真値のモーショングラフに高い類似度を示している。
  • ノイズに強く、訓練データと同様のノイズ環境下でも、クリーンな入力とノイズのある入力の両方で安定した性能を示した。
  • 訓練済みジャンルでは優れた性能を示したが、未学習の音楽トラックでテストした際にはFスコアがほぼ半減したため、未学習の音楽への一般化能力に限界があることが示された。
  • 前方伝搬時間は約12 msであり、リアルタイムアプリケーションに適したリアルタイム推論性能を達成した。
  • 対照的損失関数はビート同期性を顕著に向上させ、S2S-MCはすべてのテスト条件下でS2Sを上回った。特にノイズ環境下での性能向上が顕著であった。
Figure 2: Auto-conditioned decoder.
Figure 2: Auto-conditioned decoder.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。