Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend

Wangyou Zhang, Christoph Boeddeker|arXiv (Cornell University)|Feb 23, 2021
Speech and Audio Processing参考文献 47被引用数 33
ひとこと要約

本稿では、マルチチャネル・マルチスケイバー・リバーブ環境における統合的デリバーブレーション、ビームフォーミング、音声認識のエンドツーエンドフレームワークを提案する。周波数の順序入れ替えを軽減するためのVAD類似マスクに加え、4つの数値安定化技術(対角加重、マスク床固定、安定した複素数演算、二重精度計算)を導入することで、従来のE2E ASRと比較して35%の相対的WER低減を達成し、音声認識のための監視信号のみで、SDR = 12.5 dBという強力な音声拡張性能を実現した。

ABSTRACT

Recently, the end-to-end approach has been successfully applied to multi-speaker speech separation and recognition in both single-channel and multichannel conditions. However, severe performance degradation is still observed in the reverberant and noisy scenarios, and there is still a large performance gap between anechoic and reverberant conditions. In this work, we focus on the multichannel multi-speaker reverberant condition, and propose to extend our previous framework for end-to-end dereverberation, beamforming, and speech recognition with improved numerical stability and advanced frontend subnetworks including voice activity detection like masks. The techniques significantly stabilize the end-to-end training process. The experiments on the spatialized wsj1-2mix corpus show that the proposed system achieves about 35% WER relative reduction compared to our conventional multi-channel E2E ASR system, and also obtains decent speech dereverberation and separation performance (SDR=12.5 dB) in the reverberant multi-speaker condition while trained only with the ASR criterion.

研究の動機と目的

  • リバーブ環境およびノイズが強いマルチスケイバー環境におけるエンドツーエンドASRの著しい性能劣化を解消すること。
  • WPEおよびビームフォーマー演算における数値不安定性を解消することで、統合的エンドツーエンドデリバーブレーション・ビームフォーミング・ASRの訓練を安定化すること。
  • 訓練に使用するトランスクリプションのみで、困難なコcktailパーティー状況下での音声拡張および認識性能を向上させること。
  • WPEおよびビームフォーマーのエンドツーエンド訓練における周波数順序入れ替え問題を、VAD類似マスクを用いて軽減すること。
  • 分離されたフロントエンドの訓練を必要としない単一のE2Eシステムが、デリバーブレーション、分離、認識のすべてにおいて優れた性能を達成できることを示すこと。

提案手法

  • WPEおよびビームフォーマーの行列逆演算を安定化させるために、4つの数値安定化技術(対角加重、マスク床固定、安定した複素数演算、二重精度計算)を導入する。
  • WPEおよびビームフォーマー用のマスクを共通のマスク推定器(MaskNet)で生成することで、統合最適化を可能にする。
  • DNN-WPEを用いた因子分解型フロントエンドと、MVDR/wMPDRビームフォーマーを用いた空間フィルタリングを実装する。
  • 非音声成分を抑制し、エンドツーエンド訓練中の周波数順序入れ替えを低減するために、VAD類似マスクを適用する。
  • トランスクリプションのみで訓練される、統合的CTC/アテンションベースのASRバックエンドを採用する。
  • 予測された音声表現とターゲット表現を一致させるPITベースの損失関数を用いて、システム全体を最適化する。

実験結果

リサーチクエスチョン

  • RQ1WPEおよびビームフォーマー演算における数値不安定性は、エンドツーエンドのデリバーブレーションおよびASR訓練において効果的に軽減可能か?
  • RQ2VAD類似マスクの使用は、周波数順序入れ替えを低減させるとともに、音声拡張および認識性能を向上させるか?
  • RQ3音声認識の監視信号のみで、単一のエンドツーエンドシステムが、デリバーブレーション、ビームフォーミング、ASRを統合的に最適化可能か?
  • RQ4リバーブ環境下でのエンドツーエンド訓練において、MVDRとwMPDRのビームフォーマーの変種はどのように比較されるか?
  • RQ5提案された安定化技術は、マルチスケイバー・リバーブ環境下でのWER、SDR、PESQ、STOI指標にどのような影響を与えるか?

主な発見

  • 提案されたシステムは、空間化されたwsj1-2mixコーパスにおいて、従来のマルチチャネルエンドツーエンドASRシステムと比較して35%の相対的WER低減を達成した。
  • システムは、音声拡張のSDRが12.5 dB、PESQが1.97に達し、強力なデリバーブレーションおよび分離性能を示した。
  • 4つの安定化技術(対角加重、マスク床固定、安定した複素数演算、二重精度計算)を組み合わせた場合が、最良の収束性と性能を示した。
  • VAD類似マスクはPESQ(1.95)、STOI(0.86)、SDR(12.54 dB)を著しく向上させ、周波数順序入れ替えの影響を低減した。
  • VAD類似マスクを用いたwMPDRビームフォーマーは、9.44%の最良のWERと8.49 dBのSDRを達成し、MVDRベースのモデルを上回った。
  • VAD類似マスクおよび安定化技術を組み合わせた本フレームワークは、クリアなWSJ評価セット(4.4% WER)に近いトップライン性能(9.45% WER)を達成し、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。