Skip to main content
QUICK REVIEW

[論文レビュー] An Investigation of End-to-End Multichannel Speech Recognition for Reverberant and Mismatch Conditions

Aswin Shanmugam Subramanian, Xiaofei Wang|arXiv (Cornell University)|Apr 19, 2019
Speech and Audio Processing参考文献 34被引用数 17
ひとこと要約

本稿では、平行な綺麗音声・混浊音声データや反復推論を必要とせず、ASR目的損失のみを用いて、ニューラルの間引き処理(WPE)、ビームフォーミング(MVDR)、音声認識モデルを一括最適化するエンドツーエンドのマルチチャネルASRシステムを提案する。REVERBでは最先端の性能を達成し、不一致なDIRHAデータでも顕著な向上を示し、すべてのモジュールを同時に微分可能に訓練することで、現実の混浊・ノイズ混在環境に対しても高い耐性を示す。

ABSTRACT

Sequence-to-sequence (S2S) modeling is becoming a popular paradigm for automatic speech recognition (ASR) because of its ability to jointly optimize all the conventional ASR components in an end-to-end (E2E) fashion. This report investigates the ability of E2E ASR from standard close-talk to far-field applications by encompassing entire multichannel speech enhancement and ASR components within the S2S model. There have been previous studies on jointly optimizing neural beamforming alongside E2E ASR for denoising. It is clear from both recent challenge outcomes and successful products that far-field systems would be incomplete without solving both denoising and dereverberation simultaneously. This report uses a recently developed architecture for far-field ASR by composing neural extensions of dereverberation and beamforming modules with the S2S ASR module as a single differentiable neural network and also clearly defining the role of each subnetwork. The original implementation of this architecture was successfully applied to the noisy speech recognition task (CHiME-4), while we applied this implementation to noisy reverberant tasks (DIRHA and REVERB). Our investigation shows that the method achieves better performance than conventional pipeline methods on the DIRHA English dataset and comparable performance on the REVERB dataset. It also has additional advantages of being neither iterative nor requiring parallel noisy and clean speech data.

研究の動機と目的

  • 遠方音声応用を想定し、マルチチャネル音声強調(間引き処理とビームフォーミング)をエンドツーエンドASRに直接統合できるかを検討すること。
  • 単一の微分可能な損失関数を用いて、間引き処理、ビームフォーミング、ASRを一括最適化することで、混浊および不一致な環境下での耐性が向上するかを評価すること。
  • エンドツーエンドのマルチチャネルASRにおいて、平行な綺麗音声・混浊音声データや反復処理に依存しないようにすること。
  • 訓練データの条件と異なる実世界の遠方音声データ(例:DIRHA、REVERBリアルセット)における汎化性能を評価すること。

提案手法

  • モデルは、序列変換ASRフレームワーク内に、ニューラルWPEに基づく間引き処理とMVDRビームフォーミングを微分可能サブネットワークとして統合する。
  • 間引き処理サブネットワークは、DNNを用いて時間周波数マスクを推定し、目的信号のスペクトルマグニチュードを推定することで、反復的WPE処理を置き換える。
  • ビームフォーミングサブネットワークは、推定されたパワースペクトル密度行列から微分可能なMVDRフィルタを計算し、スピーク活動検出(SAD)タイプのマスクをオプションで使用する。
  • すべてのモジュールはASR目的損失のみを用いて一括訓練され、綺麗音声データや信号レベルの明示的監督は不要である。
  • 訓練中、間引き処理またはビームフォーミングのいずれかの分岐をランダムにスキップすることで、耐性と汎化性能を向上させる。
  • システムは入力チャネル数を任意に扱い、中間サブネットワーク出力から強化されたスペクトログラムを生成できる。

実験結果

リサーチクエスチョン

  • RQ1統合されたニューラル間引き処理とビームフォーミングを備えたエンドツーエンドASRシステムが、混浊およびノイズ混在環境下で、従来のパイプライン手法を上回る性能を示せるか?
  • RQ2ASR目的損失のみを用いて間引き処理とビームフォーミングを一括最適化することで、不一致な実世界のテストセットでも耐性のある性能が得られるか?
  • RQ3時間周波数マスク(TF)とSADマスクの異なるマスクタイプが、困難な遠方音声環境下での性能にどのように影響するか?
  • RQ4平行な綺麗音声・混浊音声データを必要とせずに、実際の遠方音声データに汎化可能か?

主な発見

  • SADマスクを用いた一括最適化モデルは、不一致なDIRHAテストセットにおいて、最良のパイプライン手法よりも相対的に5.2%のWER低減を達成した。
  • REVERBのシミュレーションセットでは、TFマスクを用いた一括E2Eモデルが最良の性能を示し、パイプラインおよび単独E2Eベースラインを上回った。
  • REVERBチャレンジの公式テストセットにおいて、特に実際の遠方音声条件下で、最先端のシステムと同等または優れた性能を達成した。
  • 未観測のチャネル構成に対しても良好に汎化され、反復処理や平行データを必要としない。
  • スペクトログラムの可視化分析から、強化出力がぼやけを低減し、背景音が明瞭であることが確認され、効果的な間引き処理とノイズ除去が行われていることが示された。
  • 信号レベルの目的関数がなくても、ASR目的損失のみを用いてすべてのモジュールを効果的に一括最適化できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。