Skip to main content
QUICK REVIEW

[論文レビュー] Single Channel Audio Source Separation using Convolutional Denoising Autoencoders

Emad M. Grais, Mark D. Plumbley|arXiv (Cornell University)|Mar 23, 2017
Speech and Audio Processing参考文献 27被引用数 14
ひとこと要約

本稿では、単一チャネル音声源分離に深層全結合畝き込み自己符号化器(CDAE)を用いることを提案する。各ソースごとに1つのCDAEを訓練し、他のソースをノイズとして扱って目的成分を抽出する。実験の結果、CDAEは前向き伝播ニューラルネットワークよりもパラメータが少ないにもかかわらず、競争力ある性能を示し、特にドラムのような困難なソースの分離において優れた性能を発揮する。

ABSTRACT

Deep learning techniques have been used recently to tackle the audio source separation problem. In this work, we propose to use deep fully convolutional denoising autoencoders (CDAEs) for monaural audio source separation. We use as many CDAEs as the number of sources to be separated from the mixed signal. Each CDAE is trained to separate one source and treats the other sources as background noise. The main idea is to allow each CDAE to learn suitable spectral-temporal filters and features to its corresponding source. Our experimental results show that CDAEs perform source separation slightly better than the deep feedforward neural networks (FNNs) even with fewer parameters than FNNs.

研究の動機と目的

  • 深層学習を用いた単一チャネル音声源分離(SCSS)の課題に対処すること。
  • 畝き込み自己符号化器(CDAE)が、ソース分離に適した強固なスペクトル的・時間的特徴を学習できるかどうかを検討すること。
  • 分離品質およびパラメータ効率の観点から、CDAEの性能を全結合型前向き伝播ニューラルネットワーク(FNN)と比較すること。
  • CDAEが、ソース分離中に極めて非定常な背景ノイズを処理する効果的さを評価すること。

提案手法

  • 各ソースは、他のソースをバックグラウンドノイズとして扱う専用のCDAEを用いて分離される。
  • CDAEアーキテクチャは、2次元畝き込み層、ReLU活性化関数、エンコーダーにおけるマックスプーリング、デコーダーにおける転置畝き込みとアップサンプリングを含む。
  • 各CDAEの入力は、混合信号の2次元マグニチュードスペクトログラムのセグメントであり、訓練中にノイズを導入することで耐性を高める。
  • エネルギー保存を保証するために、CDAE出力から以下の式を用いてスペクトルマスクを計算する:$ \mathbf{M}_{i}(n,f) = \frac{\mathbf{\tilde{S}}_{i}(n,f)}{\sum_{j}^{I}\mathbf{\tilde{S}}_{j}(n,f)} $。
  • 最終的なソース推定値は、混合信号の位相とマスク処理されたマグニチュードスペクトログラムを用いて逆STFTによって得られる。
  • 訓練にはネステロフの加速勾配法を用い、バリデーション損失を最適化するための早期停止と学習率の段階的減少を適用する。

実験結果

リサーチクエスチョン

  • RQ1全結合畝き込み自己符号化器(CDAE)は、単一チャネル音声混合信号から個々のソースを効果的に分離できるか?
  • RQ2CDAEの性能は、全結合型前向き伝播ニューラルネットワーク(FNN)と比較して、分離品質およびパラメータ効率の観点で優れているか?
  • RQ3CDAEアーキテクチャは、全結合ネットワークと比較して、音声信号のスペクトル的・時間的構造をより効果的に捉えられるか?
  • RQ4CDAEは、ドラムのような分離が特に困難なソースにおいて、どの程度の性能を示すか?
  • RQ5CDAEは、FNNよりも少ないパラメータで高品質な分離を達成できるか?

主な発見

  • CDAEはFNNと比較してわずかに優れたソース分離性能を示したが、パラメータ数は少ない。
  • CDAEは、特に分離が困難なドラムの分離において、FNNよりも顕著な改善を示した。
  • CDAEでは正規化SIRとSIRの値が正であったため、効果的な分離とノイズ抑制が確認された。
  • CDAEは、ベースを除くすべてのソースにおいてSARでFNNを上回り、分離信号に少ないアーティファクトをもたらした。
  • ボーカルおよびベースの分離において、SDRおよびSIRの観点からCDAEとFNNの性能は同等であった。
  • スペクトルマスクの使用により、推定されたソースの合計が元の混合信号に近づくことが保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。