Skip to main content
QUICK REVIEW

[論文レビュー] A cappella: Audio-visual Singing Voice Separation

Juan F. Montesinos, Venkatesh S. Kadandale|arXiv (Cornell University)|Apr 20, 2021
Speech and Audio Processing被引用数 4
ひとこと要約

本論文では、空間的時間的グラフ畳み込みネットワークを用いて顔の動き特徴を活用することで、重なった声や低音量のターゲットといった困難な状況下での分離性能を向上させる、新しい音声視覚的歌唱音声分離手法A cappellaを紹介する。提案されたY-Net-grモデルは、音声のみのU-Netおよび最先端の音声視覚的会話分離モデルを上回り、特に2人のリードボーカルと低音量のターゲットを含む最も困難なテスト設定で優れた性能を示す。

ABSTRACT

The task of isolating a target singing voice in music videos has useful applications. In this work, we explore the single-channel singing voice separation problem from a multimodal perspective, by jointly learning from audio and visual modalities. To do so, we present Acappella, a dataset spanning around 46 hours of a cappella solo singing videos sourced from YouTube. We also propose an audio-visual convolutional network based on graphs which achieves state-of-the-art singing voice separation results on our dataset and compare it against its audio-only counterpart, U-Net, and a state-of-the-art audio-visual speech separation model. We evaluate the models in the following challenging setups: i) presence of overlapping voices in the audio mixtures, ii) the target voice set to lower volume levels in the mix, and iii) combination of i) and ii). The third one being the most challenging evaluation setup. We demonstrate that our model outperforms the baseline models in the singing voice separation task in the most challenging evaluation setup. The code, the pre-trained models, and the dataset are publicly available at https://ipcv.github.io/Acappella/able at https://ipcv.github.io/Acappella/

研究の動機と目的

  • 重なった声や低音量の状況下における音声のみの歌唱音声分離モデルの限界を解決すること。
  • 特に歌唱中の顔の動きという視覚的手がかりの可能性を検討し、ソース分離性能の向上を図ること。
  • 従来、公開されていなかったため、音声視覚的歌唱音声分離のための新しいベンチマークデータセットの構築。
  • 音声スペクトログラムと顔の特徴点からの視覚的動き特徴を統合するマルチモーダルディープラーニングモデルの設計および評価。
  • 特にターゲットボーカルのエネルギーが低いか、複数の声が重なっているような困難な分離設定において、視覚的条件付けの優位性を実証すること。

提案手法

  • YouTubeベースのアカペラソロ歌唱動画約46時間分の同期音声・映像を含む新しいデータセットA cappellaを提案。
  • MediaPipeを用いて動画フレームから2次元顔の特徴点を抽出し、空間的時間的グラフ畳み込みネットワーク(ST-GCN)を用いて顔の動きダイナミクスをモデル化。
  • 視覚的動き埋め込みをU-Netベースの音声分離ネットワークの条件付けとして用い、スペクトログラム領域におけるソース分離を支援。
  • 歌唱音声の調波的・時間的構造をよりよく表現できるように、複素スペクトログラムをU-Netの入力として使用。
  • 1人または2人のリードボーカルの混合音源を、さまざまなターゲットボーカル音量レベル(α = 0.5, 1.0, 1.25, 2.0)でエンドツーエンドで学習。
  • 1人・2人分離の両テストシナリオで最適な性能を達成するため、学習データにおける2人混合音源の割合に関するアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1顔の特徴点からの視覚的動き特徴は、特に困難な状況下で音声のみのモデルの歌唱音声分離性能を向上させることができるか?
  • RQ2ターゲット歌唱ボーカルが重なった声に埋もれたり、低音量の状況下で視覚モalityを組み込むと性能にどのように影響するか?
  • RQ31人分離と2人分離の両シナリオで性能をバランスさせる最適なトレーニング戦略は何か?
  • RQ4本研究で提案する音声視覚モデルは、歌唱音声文脈において最先端の音声視覚的会話分離モデルと比較してどう異なるか?
  • RQ5ターゲットボーカルが他のソースと周波数的・時間的に類似している状況下で、視覚的動き特徴が分離性能にどれほど向上効果をもたらすか?

主な発見

  • Y-Net-grモデルは、2人のリードボーカルと低音量ターゲット(α = 0.5)を含む最も困難なテスト設定で、平均SDR(7.27)およびSIR(17.6)の最高値を達成した。
  • 2人混合・低音量設定下では、音声のみのU-Net(SDR: 2.07 vs. 1.29)および音声視覚的会話モデルLLCP(SDR: 2.07 vs. 1.76)を上回った。
  • 学習時に2人混合音源を50%含むモデルが、1人・2人分離の両テストシナリオで最も良好な妥協点を示し、平均SDR 8.19およびSIR 17.21を達成した。
  • 視覚的条件付けは低音量状況下での性能向上に顕著な効果を示した:Y-Net-grはα = 1.0(1人)でSDR 11.08、α = 1.0(2人)でSDR 6.42を達成し、音声のみのU-NetおよびLLCPを上回った。
  • アブレーションスタディにより、2人混合音源を学習に含めることで、特に低音量ターゲットの一般化性能が向上することが確認され、1人分離のテストケースでも同様の効果が得られた。
  • Y-Net-grモデルは、すべての評価設定で最先端の音声視覚的会話分離モデルLLCPを上回り、特に2人混合・低音量ケースで顕著な優位性を示した。これは、歌唱に特化した視覚モデリングの利点を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。