Skip to main content
QUICK REVIEW

[論文レビュー] Deep Filtering: Signal Extraction Using Complex Time-Frequency Filters.

Wolfgang Mack, Emanuël A. P. Habets|arXiv (Cornell University)|Apr 17, 2019
Speech and Audio Processing被引用数 6
ひとこと要約

本稿では、教師ありフィルタの必要がない複雑な時間周波数フィルタを推定するための深層ニューラルネットワークを用いた Deep Filtering を提案する。この手法は再構成誤差を直接最小化することで、単一チャネル音声分離に適したフィルタを学習する。ノッチフィルタや時間フレームのゼロ化といった困難な条件下でも、実時間周波数マスクおよび複素時間周波数マスクのベースラインを上回る性能を示した。

ABSTRACT

Signal extraction from a single-channel mixture with additional undesired signals is most commonly performed using time-frequency (TF) masks. Typically, the mask is estimated with a deep neural network (DNN) and element-wise applied to the complex mixture short-time Fourier transform (STFT) representation to perfom extraction. Ideal mask magnitudes are zero for solely undesired signals in a TF bin and infinity for total destructive interference. Usually, masks have an upper bound to provide well-defined DNN outputs at the cost of limited extraction capabilities. We propose to estimate with a DNN a complex TF filter for each mixture TF bin which maps an STFT area in the respective mixture to the desired TF bin to address destructive interference in mixture TF bins. The DNN is optimized by minimizing the error between the extracted and the groundtruth desired signal allowing to train without having to specify ground-truth TF filters but learn filters by error reduction. We compare our approach with complex and real valued TF masks by separating speech from a variety of different sound and noise classes from the Google AudioSet corpus. We also process the mixture STFT with notch filters and zero whole time-frames to demonstrate the reconstruction capabilities of our approach. The proposed method outperformed the baselines especially when notch filters and time-frame zeroing were applied.

研究の動機と目的

  • 単一チャネル音声分離における時間周波数マスクの破壊的干渉の処理に限界があることに対処する。
  • マスク推定における上界の制約が引き起こすネットワーク出力の安定性と抽出能力のトレードオフを克服する。
  • 教師ありフィルタの必要がない、複素時間周波数フィルタのエンドツーエンド学習を可能にする。
  • 現実世界の条件下でスペクトル歪み(ノッチフィルタや時間フレームのゼロ化など)に対して頑健であることを示す。

提案手法

  • 混合音声のSTFTの各時間周波数(TF)ビンに対して、複素時間周波数フィルタを予測するための深層ニューラルネットワークを訓練する。
  • 推定されたフィルタを用いて、各TFビンの周囲のSTFT領域を目的信号成分にマッピングし、干渉の低減を実現する。
  • 抽出信号と真の目的信号との間の再構成誤差を最小化することでネットワークを最適化する。
  • 混合音声の複素STFT表現を入力とし、時間周波数ドメイン上で直接作用するフィルタを予測する。
  • トレーニング中に誤差逆伝播に依存することで、明示的な教師ありフィルタの必要性を回避する。
  • 各ビン単位で混合音声のSTFTに学習済みフィルタを適用し、目的信号を再構成する。

実験結果

リサーチクエスチョン

  • RQ1教師ありフィルタの必要がない条件下で、深層ニューラルネットワークが有効な複素時間周波数フィルタを学習できるか?
  • RQ2提案手法のフィルタベースアプローチは、従来の実時間周波数マスクおよび複素時間周波数マスク手法と比較して、分離品質にどの程度優れているか?
  • RQ3ノッチフィルタや時間フレームのゼロ化といったスペクトル劣化に対して、提案手法はどの程度の性能を維持できるか?
  • RQ4出力に制限を設けるマスクベース手法と比較して、信号再構成誤差によるエンドツーエンド最適化が、より優れた一般化性能をもたらすか?

主な発見

  • 提案された Deep Filtering 手法は、音声分離タスクにおいて、実時間周波数マスクおよび複素時間周波数マスクのベースラインを上回った。
  • ノッチフィルタによる劣化処理においても優れた頑健性を示し、スペクトルノードの処理能力に優れていることがわかった。
  • 時間フレーム全体がゼロにされた状態でも高い性能を維持しており、優れた信号再構成能力を示した。
  • フィルタ推定に上界がないため、制限付きマスク手法と比較して、干渉成分の抑制がより効果的に行えるようになった。
  • ネットワークは混合音声のSTFT領域をターゲットTFビンにマッピングする能力を学習しており、学習済みの複素フィルタを用いた高精度な信号抽出が可能になった。
  • 特に困難なスペクトル条件下でも、Google AudioSet コーパスにおいて最先端の性能を達成した。多彩なノイズおよび音声クラスの分類において顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。