Skip to main content
QUICK REVIEW

[論文レビュー] Music Gesture for Visual Sound Separation

Chuang Gan, Deng Huang|arXiv (Cornell University)|Apr 20, 2020
Speech and Audio Processing参考文献 56被引用数 6
ひとこと要約

本稿では、音楽家の身体および手の動きをキーポイントベースの視覚的表現としてモデル化することで、視覚的音源分離を向上させる Music Gesture を提案する。文脈に配慮したグラフネットワークと音声・視覚融合モジュールを統合することで、異種および、初めてとしての同種楽器分離(特にピアノ、フルート、トランペットのデュオ)において最先端の性能を達成した。

ABSTRACT

Recent deep learning approaches have achieved impressive performance on visual sound separation tasks. However, these approaches are mostly built on appearance and optical flow like motion feature representations, which exhibit limited abilities to find the correlations between audio signals and visual points, especially when separating multiple instruments of the same types, such as multiple violins in a scene. To address this, we propose "Music Gesture," a keypoint-based structured representation to explicitly model the body and finger movements of musicians when they perform music. We first adopt a context-aware graph network to integrate visual semantic context with body dynamics, and then apply an audio-visual fusion model to associate body movements with the corresponding audio signals. Experimental results on three music performance datasets show: 1) strong improvements upon benchmark metrics for hetero-musical separation tasks (i.e. different instruments); 2) new ability for effective homo-musical separation for piano, flute, and trumpet duets, which to our best knowledge has never been achieved with alternative methods. Project page: http://music-gesture.csail.mit.edu.

研究の動機と目的

  • 外観やオプティカルフロー特徴に依存する既存の視覚的音源分離モデルの限界(複数のバイオリンなど類似楽器を区別できないこと)を解決する。
  • 同じ楽器タイプ(例:2台のピアノ)からの音源分離を効果的に可能とすること、これは従来の手法では未解決であったタスクである。
  • キーポイント追跡を通じて、構造的な人間の身体および手の動きの手がかりを活用し、音声・視覚の整合性と分離性能を向上させる。
  • 動的視覚キーポイントを条件として音声特徴予測を行う、頑健な音声・視覚融合メカニズムを開発する。
  • ピアノ、フルート、トランペットなど、細かく分類された手の動きを示す楽器を含む多様な楽器に一般化することを示す。

提案手法

  • ビデオフレームからの視覚的意味的文脈と人間の身体ダイナミクスを同時にモデル化する文脈に配慮したグラフニューラルネットワークを用いる。
  • ポーズ推定バックボーンを用いて、音楽家の身体および手の2次元キーポイント座標を抽出し、音楽的ジェスチャーの構造的表現を形成する。
  • 関連する身体キーポイントに注目し、視覚的動きの手がかりに基づいて音声特徴を調整する音声・視覚融合モジュールを設計する。
  • まず複数楽器分離で、その後同種楽器デュオで微調整する、自己教師付きのミックス・アンド・セパレートフレームワークでモデルを訓練する。
  • より簡単な(異種)からより難しい(同種)分離タスクへと段階的に学習を進めるカリキュラム学習戦略を適用する。
  • 分離品質の評価に、自動的な SDR スコアと Amazon Mechanical Turk での人間評価を併用する。

実験結果

リサーチクエスチョン

  • RQ1身体および手の動きの構造的キーポイントベース表現は、外観やオプティカルフロー特徴を上回る視覚的音源分離を可能にするか?
  • RQ2音楽的ジェスチャーの明示的モデリングにより、ピアノやフルートのデュオなど、同じ楽器タイプからの音源分離が有効に可能になるか?
  • RQ3音声・視覚融合モジュールの注目メカニズムは、分離の過程で異なる身体部位にどのように注目を向けるか?
  • RQ4本手法は、物理的ジェスチャーの複雑さに差がある楽器間で一般化可能か?
  • RQ5カメラの視点変化や部分的隠蔽がある現実世界の条件下でも、本手法の性能は保たれるか?

主な発見

  • 提案手法の Music Gesture は、SoM [56] と比較してピアノデュオで 3.8 dB、フルートデュオで 5.3 dB の SDR 向上を達成し、同種分離において強力な性能を示した。
  • 人間評価では、ピアノデュオで 70%、フルートデュオで 86% の被験者が本手法を SoM より好む結果となり、優れた知覚的品質を示した。
  • バイオリンデュオでは 6.7 SDR、チェロデュオでは 6.1 SDR を達成し、SoM の 6.3 と 5.4 を上回り、異種タスクにおいても一貫した向上を示した。
  • 注目マップの可視化から、フルートやギターのような楽器では手のキーポイントに注目しているのに対し、チェロやバイオリンのような弓奏楽器では肘に注目していることがわかった。
  • 実混合音源において、SoM よりも本手法はより頑健であった。SDR スコアは類似していたが、人間評価では著しく高い好みが得られた。
  • 本手法は、ピアノ、フルート、トランペットの同種楽器デュオ分離の、これまで報告された初めての有効な結果を達成した。これは従来のアプローチでは到達できなかったタスクであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。