Skip to main content
QUICK REVIEW

[論文レビュー] Bootstrapping deep music separation from primitive auditory grouping principles

Prem Seetharaman, Gordon Wichern|arXiv (Cornell University)|Oct 23, 2019
Speech and Audio Processing参考文献 26被引用数 6
ひとこと要約

本稿では、ピッチの近接性、繰り返し、トーンなど、複数の原始的聴覚的グループ化ヒント(例:ピッチの近接性、繰り返し、トーン)を活用することで、教師なしで深層音楽ソース分離モデルを訓練する自己教師付き手法を提案する。複数の原始的アルゴリズムからの信頼度推定値を用いて、ラベルなしのYouTube音楽ミックスから高品質なソース分離結果をフィルタリングし、それらを再ミックスして合成学習データを作成。その後、深層クラスタリングネットワークを微調整することで、3.39 dBのSDRを達成。これは原始的アンサンブルを上回り、教師ありベースラインに近い性能を示した。

ABSTRACT

Separating an audio scene such as a cocktail party into constituent, meaningful components is a core task in computer audition. Deep networks are the state-of-the-art approach. They are trained on synthetic mixtures of audio made from isolated sound source recordings so that ground truth for the separation is known. However, the vast majority of available audio is not isolated. The brain uses primitive cues that are independent of the characteristics of any particular sound source to perform an initial segmentation of the audio scene. We present a method for bootstrapping a deep model for music source separation without ground truth by using multiple primitive cues. We apply our method to train a network on a large set of unlabeled music recordings from YouTube to separate vocals from accompaniment without the need for ground truth isolated sources or artificial training mixtures.

研究の動機と目的

  • 実世界の音声データにおいて、分離されたソースが入手できないため、合成ミックスに教師付きの分離ソースが必要な深層ソース分離モデルの限界を克服すること。
  • 分離されたソースの録音が入手できない大規模なラベルなし音声データセット(例:YouTube)上で、深層ニューラルネットワークを訓練できること。
  • 教師なしで性能を予測可能な、原始的分離出力の信頼度測定を考案し、高品質な学習例をフィルタリング可能にすること。
  • 原始的クラスタリングから得られる高信頼度のソース推定値を用いて、合成学習データを生成し、ブートストラップされたモデルが未学習のミックスに一般化できることを示すこと。

提案手法

  • 音楽ミックスの生データに複数の原始的聴覚的グループ化アルゴリズム(例:HPSSによるハーモニック/パーカッション分離、Melodiaによるピッチの近接性、2DFT-M/Rによるマイクロ変調と繰り返し)を適用し、ソフトな時間周波数マスクを生成する。
  • これらの原始的アルゴリズムの出力を、各時間周波数点ごとに2次元埋め込み空間に統合し、各次元が1つの原始的要因のセグメンテーション意思決定に対応する。
  • 得られた原始的クラスタリングを用いて、ラベルなしの音楽ミックスから初期のソース推定(ボーカルとアコーパメント)を生成する。
  • 時間周波数点全体にわたる原始的意思決定の一貫性に基づく信頼度測定を考案。これは分離品質と相関(MUSDB上でのSDRと相関係数r = 0.56)を示す。
  • 信頼度でソース推定値を四分位に分け、高信頼度のもの(Q2~Q4)を再ミックスし、20,000件の合成学習ミックスを生成。
  • マグニチュード重みとADAM最適化を用いた標準的損失関数で、4層のBLSTM(20次元埋め込み)を用いた深層クラスタリングネットワークを、再ミックスデータ上で学習。

実験結果

リサーチクエスチョン

  • RQ1複数の原始的聴覚的グループ化ヒントを効果的に統合することで、教師なしで高品質な初期ソース分離を達成できるか?
  • RQ2教師なしで、原始的クラスタリングの意思決定の一貫性に基づく信頼度測定が、実際の分離品質を予測できるか?
  • RQ3原始的クラスタリングから得られる高信頼度のソース推定値を用いて、合成学習データを生成し、深層ネットワークが未学習のミックスに一般化できるか?
  • RQ4YouTubeなどから得られる多様性とスケールの大きな学習データを増やすことで、ブートストラップされた深層ソース分離モデルの性能が向上するか?
  • RQ5この自己教師付きパイプラインで訓練されたモデルが、教師ありベースラインと競合可能な性能を達成できるか?

主な発見

  • 原始的クラスタリングから導出した信頼度測定は、MUSDB学習セット上で実際の分離品質と中程度の相関(r = 0.56)を示し、低品質な学習例の効果的フィルタリングが可能であることを示した。
  • 原始的クラスタリング出力の最高信頼度四分位(Q4)から得た再ミックスデータで学習した深層ネットワークは、MUSDBテストセットで3.39 dBのSDRを達成。これは原始的クラスタリングベースライン(2.93 dB SDR)を上回った。
  • MUSDBとYouTube(追加831曲)の両方のデータで学習したモデルも3.39 dB SDRを達成。データの多様性が性能向上に寄与したことを示した。
  • ブートストラップモデル(3.39 dB SDR)と教師ありの真値ネットワークとの性能差は、学習データ量の増加に伴い縮小したが、依然として顕著な差が残った。
  • MUSDBの再ミックスデータのみで学習したモデルは、原始的クラスタリングベースライン(2.71 dB vs 2.93 dB SDR)を下回った。これは、成功のためにはデータの多様性が不可欠であることを示した。
  • 本手法により、任意のラベルなし音声ミックス上で深層ソース分離モデルを訓練可能となり、実世界の音声からの継続的で自己教師付きの学習の道を開いた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。