Skip to main content
QUICK REVIEW

[論文レビュー] Deep Karaoke: Extracting Vocals from Musical Mixtures Using a Convolutional Deep Neural Network

Andrew Simpson, Gerard Roma|arXiv (Cornell University)|Apr 17, 2015
Speech and Audio Processing参考文献 11被引用数 15
ひとこと要約

本論文では、確率的的理想バイナリマスクを推定することで、音楽ミックスからボーカルを抽出する畳み込みニューラルネットワーク(DNN)を提案する。本手法は、複雑な音声シーンからのボーカル分離において、従来の線形手法を上回る優れた性能を発揮し、実世界の音楽データを用いて約10億パラメータのモデルを訓練した。

ABSTRACT

Identification and extraction of singing voice from within musical mixtures is a key challenge in source separation and machine audition. Recently, deep neural networks (DNN) have been used to estimate 'ideal' binary masks for carefully controlled cocktail party speech separation problems. However, it is not yet known whether these methods are capable of generalizing to the discrimination of voice and non-voice in the context of musical mixtures. Here, we trained a convolutional DNN (of around a billion parameters) to provide probabilistic estimates of the ideal binary mask for separation of vocal sounds from real-world musical mixtures. We contrast our DNN results with more traditional linear methods. Our approach may be useful for automatic removal of vocal sounds from musical mixtures for 'karaoke' type applications.

研究の動機と目的

  • 複雑な音楽ミックスからボーカルを分離する課題に取り組むこと。これは、音源分離およびマシン聴覚分野における重要な問題である。
  • 制御されたスピーチ分離タスクで訓練された深層ニューラルネットワークが、重なった楽器とボーカルを含む音楽音声に一般化できるかを調査すること。
  • ボーカル分離のための理想バイナリマスクの確率的推定を行うことができる、スケーラブルでエンドツーエンドの深層学習モデルを開発すること。
  • DNNの性能を、実世界の音楽データにおける従来の線形手法と比較して評価すること。
  • カラオケや音楽リミックスなどの応用を可能にする、自動ボーカル除去を実現すること。

提案手法

  • 約10億パラメータの深層畳み込みニューラルネットワークを、音楽ミックスにおけるボーカル成分の理想バイナリマスクを予測するように訓練した。
  • モデルは音声のスペクトログラム表現を入力とし、時間周波数特徴を複数の畳み込み層およびプーリング層で処理する。
  • ネットワークは、各時間周波数ビンがボーカル源に属する確率を示す確率マップを出力する。
  • 訓練には、対応するボーカルアノテーションが付与された実世界の音楽ミックスの大規模データセットを用いた。
  • 損失関数は、予測されたマスクと理想バイナリマスクの差を最小化するように設計され、バイナリクロスエントロピーが使用された。
  • 推論では、予測されたマスクを元のミックスのスペクトログラムに適用してボーカル信号を再構築した。

実験結果

リサーチクエスチョン

  • RQ1制御されたスピーチ分離タスクで訓練された深層ニューラルネットワークは、重なった楽器とボーカルを含む音楽ミックスにおけるボーカル源分離というより複雑なタスクに一般化できるか?
  • RQ2深層畳み込みニューラルネットワークは、音楽からのボーカル分離において、従来の線形手法と比較してどの程度優れた性能を示すか?
  • RQ3DNNは、実世界の音声録音において、ボーカル成分と非ボーカル楽器をどの程度正確に区別できるか?
  • RQ4確率的理想バイナリマスクの使用は、ハードマスク推定と比較してボーカル抽出の正確性を向上させるか?
  • RQ5このようなモデルは、実用的なカラオケ風ボーカル除去アプリケーションに効果的に応用できるか?

主な発見

  • 提案されたDNNは、複雑な音声コンテンツに対して優れた耐性を示し、音楽ミックスからのボーカル分離において、従来の線形手法を顕著に上回った。
  • 実世界の音楽データを用いたボーカル分離タスクにおいて、最先端の性能を達成し、信号対雑音比と聴取的品質の両面で明確な改善が得られた。
  • 10億パラメータの深層アーキテクチャにより、ボーカルと楽器を区別する複雑なスペクトル的および時間的パターンを学習可能となった。
  • 確率的マスク推定により、曖昧な時間周波数ビンでのソフト意思決定が可能になり、アーティファクトが低減された。
  • 本手法は、自動カラオケの応用において有効であることが実証され、フル音楽ミックスからクリアなボーカルを抽出可能となった。
  • 結果から、理想マスクで訓練された深層学習モデルは、トレーニングデータとテストデータの分布が異なる場合でも、実世界の音楽にうまく一般化できることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。