Skip to main content
QUICK REVIEW

[論文レビュー] Joint Separation and Denoising of Noisy Multi-talker Speech using Recurrent Neural Networks and Permutation Invariant Training

Morten Kolbæk, Dong Yu|VBN Forskningsportal (Aalborg Universitet)|Aug 31, 2017
Speech and Audio Processing参考文献 22被引用数 6
ひとこと要約

本論文では、ノイジーサイレント環境下のマルチトークン状況を想定し、発話単位のパーミュテーション不変訓練(uPIT)で学習された双方向LSTM RNNを用いた、同時音声分離およびノイズ除去フレームワークを提案する。この手法は、多様なノイズ種別およびSNRにおいてSDRおよびESTOIの顕著な向上を達成し、未学習のノイズや話者数の事前知識なしに2人および3人の話者混合に対しても良好な一般化性能を示す。

ABSTRACT

In this paper we propose to use utterance-level Permutation Invariant Training (uPIT) for speaker independent multi-talker speech separation and denoising, simultaneously. Specifically, we train deep bi-directional Long Short-Term Memory (LSTM) Recurrent Neural Networks (RNNs) using uPIT, for single-channel speaker independent multi-talker speech separation in multiple noisy conditions, including both synthetic and real-life noise signals. We focus our experiments on generalizability and noise robustness of models that rely on various types of a priori knowledge e.g. in terms of noise type and number of simultaneous speakers. We show that deep bi-directional LSTM RNNs trained using uPIT in noisy environments can improve the Signal-to-Distortion Ratio (SDR) as well as the Extended Short-Time Objective Intelligibility (ESTOI) measure, on the speaker independent multi-talker speech separation and denoising task, for various noise types and Signal-to-Noise Ratios (SNRs). Specifically, we first show that LSTM RNNs can achieve large SDR and ESTOI improvements, when evaluated using known noise types, and that a single model is capable of handling multiple noise types with only a slight decrease in performance. Furthermore, we show that a single LSTM RNN can handle both two-speaker and three-speaker noisy mixtures, without a priori knowledge about the exact number of speakers. Finally, we show that LSTM RNNs trained using uPIT generalize well to noise types not seen during training.

研究の動機と目的

  • 現実的でノイジーな環境下における同時音声分離とノイズ除去の課題に取り組み、理想的なノイズなし条件を超える。
  • uPITを用いて話者独立型マルチトークン分離におけるラベルのパーミュテーション問題を克服し、正しい話者割り当てを伴うエンドツーエンド学習を可能にする。
  • ノイズ種別、SNR、話者数(2人および3人混合)の変動に対して、モデルのロバストネスおよび一般化性能を評価する。
  • 1つのディープラーニングモデルが、再訓練や事前知識なしに複数のノイズ種別および話者数を処理できることを実証する。
  • uPITで学習された双方向LSTMネットワークの、合成および実生のノイズ信号を含む実世界的条件下での性能を調査する。

提案手法

  • 単一チャネルのマルチトークン音声混合信号における時間的依存性をモデル化するため、双方向長短期記憶(LSTM)再帰的ニューラルネットワークを採用する。
  • 発話単位のパーミュテーション不変訓練(uPIT)を適用し、話者割り当てと信号再構成を同時に最適化することで、学習中のラベルパーミュテーション問題を解決する。
  • 複数の信号対ノイズ比(SNR)で、音声とさまざまなノイズ種別(合成および実生)を含むノイズ混合信号を用いてモデルを学習する。
  • 入力および出力信号を周波数ドメインで表現するために短時間フーリエ変換(STFT)を用い、スペクトルマスキングおよび損失計算を可能にする。
  • 推定ソースのパーミュテーションのうち、総体的な再構成誤差を最小化するものを選択する損失関数を最適化に用いる。
  • 多様なテスト条件下で、信号対歪み比(SDR)および拡張短時間目的的聞き取りやすさ(ESTOI)の指標を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1uPITで学習された双方向LSTMネットワークは、ノイジーなマルチトークン音声状況下で、ロバストな同時分離およびノイズ除去を達成できるか?
  • RQ2モデルの性能は、ノイズ種別およびSNR(推論時における未学習のノイズを含む)によってどのように変化するか?
  • RQ31つのモデルが、話者数の事前知識なしに2人および3人の話者混合にどの程度一般化できるか?
  • RQ4訓練データに存在しない実生のノイズ信号を用いたテストにおいて、モデルの性能はいかがなっているか?
  • RQ5単一ノイズ種別ではなく複数ノイズ種別で学習させた場合、一般化性能および性能にどのような影響があるか?

主な発見

  • uPITで学習された双方向LSTM RNNは、複数のノイズ種別およびSNRにおいて、困難な条件下でもSDRおよびESTOIの顕著な向上を達成する。
  • 複数ノイズ種別で学習したモデルは、単一ノイズ種別で学習したモデルと比較してわずかな性能低下しか示さず、強い性能を維持する。
  • 1つのuPITで学習されたモデルは、話者数の事前知識なしに2人および3人の話者混合を正常に処理でき、強力な一般化性能を示す。
  • 未学習のノイズ種別、特にバブル、ストリート、車のノイズなど実生のノイズ信号に対しても、良好な一般化性能を示し、性能低下は最小限に抑えられる。
  • 平均して、最も優れた性能を示したモデル(LSTM5)は、すべてのテストセットで平均ESTOI向上が0.15に達し、一部の条件下では0.30を超える向上を示す。
  • BUSおよびPEDのテストセットでは、それぞれ平均ESTOI向上が0.12および0.10に達し、実世界のノイズ条件下でも強力な性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。