Skip to main content
QUICK REVIEW

[論文レビュー] Multi-channel Multi-frame ADL-MVDR for Target Speech Separation

Zhuohuang Zhang, Yong Xu|arXiv (Cornell University)|Dec 24, 2020
Speech and Audio Processing参考文献 78被引用数 5
ひとこと要約

本稿では、RNNベースのフィルタリングを用いて、ニューラルマスク推定と時間変動型ビームフォーミング重みを同時に最適化する、マルチチャネル・マルチフレームの完全ディープラーニングMVDR(MCMF ADL-MVDR)フレームワークを提案する。非線形歪みと残存ノイズを顕著に低減し、音声品質、話者理解性、ASR精度の分野で最先端の性能を達成した。推論コストが同等の他の純粋ニューラルネットワーク型および従来のニューラルマスクベースMVDRシステムを上回った。

ABSTRACT

Many purely neural network based speech separation approaches have been proposed to improve objective assessment scores, but they often introduce nonlinear distortions that are harmful to modern automatic speech recognition (ASR) systems. Minimum variance distortionless response (MVDR) filters are often adopted to remove nonlinear distortions, however, conventional neural mask-based MVDR systems still result in relatively high levels of residual noise. Moreover, the matrix inverse involved in the MVDR solution is sometimes numerically unstable during joint training with neural networks. In this study, we propose a multi-channel multi-frame (MCMF) all deep learning (ADL)-MVDR approach for target speech separation, which extends our preliminary multi-channel ADL-MVDR approach. The proposed MCMF ADL-MVDR system addresses linear and nonlinear distortions. Spatio-temporal cross correlations are also fully utilized in the proposed approach. The proposed systems are evaluated using a Mandarin audio-visual corpus and are compared with several state-of-the-art approaches. Experimental results demonstrate the superiority of our proposed systems under different scenarios and across several objective evaluation metrics, including ASR performance.

研究の動機と目的

  • 純粋にニューラルネットワーク型の音声分離システムにおける非線形歪みと残存ノイズがASR性能を低下させることに対処すること。
  • 深層ネットワークと共同で訓練する際の従来のニューラルマスクベースMVDRシステムにおける数値的不安定性を克服すること。
  • 複数チャネルおよび複数フレームにおける空間的・時間的相互相関を活用して、より優れた音声分離を実現すること。
  • 低遅延かつ高効率な、エンドツーエンドでトレーニング可能でオンライン対応のビームフォーミングシステムを開発すること。
  • 音声品質、話者理解性、および自動音声認識精度において優れた性能を達成すること。

提案手法

  • 時間周波数マスク推定のための深層ニューラルネットワーク(DNN)と、RNNで予測されたビームフォーミング重みを用いる学習済み時間変動型MVDRビームフォーマーを統合する。
  • マイクロホンアレイおよび隣接フレーム間の空間的・時間的相関を同時にモデル化するため、マルチチャネル・マルチフレーム(MCMF)アプローチを採用する。
  • RNNベースのネットワーク(GRU-Nets)を用いて動的ビームフォーミング重みを予測し、従来のMVDRにおける行列逆行列計算と数値的不安定性を回避する。
  • 位相成分と大きさ成分を同時にモデル化するため、複素比フィルタリング(cRF)を適用し、分離精度を向上させる。
  • チャネルベースのMVDR手法とは異なり、再帰的更新によりビームフォーミング重みを更新することで、ストリーミング対応のオンライン推論を可能にする。
  • 音声品質とASR性能の両方を最適化する微分可能損失関数を用いて、システム全体をエンドツーエンドでトレーニングする。

実験結果

リサーチクエスチョン

  • RQ1ニューラルマスク推定と適応的ビームフォーミングの共同学習フレームワークは、ディープラーニングベース音声分離における非線形歪みを低減できるか?
  • RQ2複数フレームおよび複数チャネルの空間的・時間的相関を組み込むことで、分離性能が向上し、残存ノイズが低減するか?
  • RQ3RNNベースのビームフォーミング重み予測は、ニューラルマスクベースMVDRシステムにおける数値的不安定性問題を解消できるか?
  • RQ4提案されたADL-MVDRシステムは、純粋ニューラル型または従来のニューラルマスクベースMVDRシステムを上回るASR精度と音声品質を達成できるか?
  • RQ5モデルサイズを小さくした場合でも、リアルタイムでストリーミング推論を維持できるか?

主な発見

  • MC ADL-MVDR(コンact)モデルは、モデルサイズを小さくしたにもかかわらず、cRFを用いたMVDRと比較してPESQで15%相対的向上、Si-SNRで27%向上、WERで18%向上を達成した。
  • 提案システムはPESQ 3.37、WER 13.01%を達成し、類似した推論時間(27.0 ms 対 31.3 ms)のcRFを用いたMVDRベースライン(PESQ: 2.90、WER: 16.74%)を上回った。
  • モデルサイズの増大(例:より大きなDNNやMVDRシステム)のみでは最小限の向上が得られ、性能向上は容量の増加ではなく、アーキテクチャの革新に起因していることを示した。
  • RNNベースのビームフォーマーは、従来のMVDRシステムが行列逆行列を必要とするのとは異なり、共同訓練中に数値的不安定性を回避した。
  • 低残存ノイズと最小限の非線形歪みを維持しており、比較対象のすべての手法の中で最高の客観的スコアと最低のWERを達成した。
  • 再帰的ビームフォーミング重み更新により、チャンクベースのMVDRシステムとは異なり、効率的なストリーミング処理が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。