Skip to main content
QUICK REVIEW

[論文レビュー] Building state-of-the-art distant speech recognition using the CHiME-4 challenge with a setup of speech enhancement baseline

Szu-Jui Chen, Aswin Shanmugam Subramanian|arXiv (Cornell University)|Mar 27, 2018
Speech and Audio Processing参考文献 19被引用数 5
ひとこと要約

本論文は、Kaldi ASRツールキットを用いて公開可能で再現可能な、CHiME-4チャレンジの遠距離音声認識のための単一システムとして、双方向LSTMベースの一般化固有値ビームフォーマー、lattice-free MMIで学習したTDNN、LSTM言語モデル再スコアリングを用いた最先端の音声認識システムを提示する。マルチチャネルのデータ拡張と強化出力を組み合わせることで、本システムは実際のテストセットで2.74% WERを達成し、チャレンジで2位を獲得した。

ABSTRACT

This paper describes a new baseline system for automatic speech recognition (ASR) in the CHiME-4 challenge to promote the development of noisy ASR in speech processing communities by providing 1) state-of-the-art system with a simplified single system comparable to the complicated top systems in the challenge, 2) publicly available and reproducible recipe through the main repository in the Kaldi speech recognition toolkit. The proposed system adopts generalized eigenvalue beamforming with bidirectional long short-term memory (LSTM) mask estimation. We also propose to use a time delay neural network (TDNN) based on the lattice-free version of the maximum mutual information (LF-MMI) trained with augmented all six microphones plus the enhanced data after beamforming. Finally, we use a LSTM language model for lattice and n-best re-scoring. The final system achieved 2.74\% WER for the real test set in the 6-channel track, which corresponds to the 2nd place in the challenge. In addition, the proposed baseline recipe includes four different speech enhancement measures, short-time objective intelligibility measure (STOI), extended STOI (eSTOI), perceptual evaluation of speech quality (PESQ) and speech distortion ratio (SDR) for the simulation test set. Thus, the recipe also provides an experimental platform for speech enhancement studies with these performance measures.

研究の動機と目的

  • CHiME-4チャレンジで用いられる複雑な複数システムの統合手法に匹敵またはそれを上回る性能を示す、簡素化された単一システムベースラインを構築すること。
  • Kaldi ASRツールキットを用いて、騒音環境下のマルチチャネルASRおよび音声強調分野の研究を促進する、公開可能で再現可能なレシピを提供すること。
  • 音声強調品質の迅速な評価を可能にするために、STOI、eSTOI、PESQ、SDRといった客観的音声強調指標をトレーニングおよび評価パイプラインに統合すること。
  • ビームフォーミングで得た強化信号を用いたデータ拡張が、特に高度な音声モデルを組み合わせた場合に、ASR性能を顕著に向上させることを示すこと。
  • 音声強調と認識モジュールをエンドツーエンドに統合し、高度な言語モデルを組み合わせることで、システム統合を必要としない最先端の性能を達成できることを示すこと。

提案手法

  • 一般化固有値ビームフォーミング(Gev)におけるマスク推定に双方向LSTM(BLSTM)を採用し、従来の遅延・和算ビームフォーマーに比べてノイズ抑制性能を向上させる。
  • 時間遅延ニューラルネットワーク(TDNN)をlattice-free最大相互情報量(LF-MMI)で学習することで、長期的な依存関係をよりよく捉えることが可能になる。
  • 6つのマイクロホンすべてとビームフォーミングによる強化出力を含むマルチチャネルデータ拡張を実施し、トレーニングデータの多様性を向上させる。
  • 2段階のデコード戦略を採用:最初の段階でTDNNを用いてラティスを生成し、2番目の段階で5-gram言語モデルと重要度サンプリングを用いたより強力なLSTM言語モデル(LSTMLM)による再スコアリングを実施。
  • STOI、eSTOI、PESQ、SDRの4つの客観的音声強調指標をレシピに統合し、ASRデコードを必要とせずに強調品質の迅速な評価が可能になる。
  • システム全体をKaldi ASRツールキット内に実装し、GitHubリポジトリを公開することで、再現可能性とアクセシビリティを確保した。

実験結果

リサーチクエスチョン

  • RQ1単一で統合されたASRシステムは、CHiME-4チャレンジでトップクラスの複数システム統合手法に匹敵する性能を達成できるか?
  • RQ2ビームフォーミング後の強化音声信号をトレーニングデータに組み込むことで、騒音環境下のマルチチャネル環境におけるASRのロバスト性はどの程度向上するか?
  • RQ3実世界の騒音環境下において、従来のビームフォーマーに比べてBLSTMベースのマスク推定が、一般化固有値ビームフォーミングでどの程度優れた性能を示すか?
  • RQ4lattice-free MMIで学習したTDNN音声モデルにLSTMLM再スコアリングを組み合わせることで、標準的なDNN+sMBRシステムに比べて語誤り率(WER)はどの程度低下するか?
  • RQ5STOI、PESQ、SDRといった客観的強調指標は、実際のASR性能とどの程度相関しているか。また、強調アルゴリズムの評価のための信頼できる代理指標として機能するか?

主な発見

  • 提案された単一システム手法は、6チャネルトラックの実際のテストセットで2.74% WERを達成し、CHiME-4チャレンジで2位となり、公式ベースライン比で76%の相対的改善を達成した。
  • 6つのマイクロホンに加えてビームフォーマーによる強化信号を含むデータ拡張により、一貫したWERの低減が得られ、最良の設定で実テストデータで2.74% WERを達成した。
  • TDNNにLF-MMIとLSTMLM再スコアリングを組み合わせることで、RNNLMを用いた場合の3.79%から6チャネルトラックで2.85%にWERが低下し、高度な言語モデルの有効性が示された。
  • BLSTMマスクベースのビームフォーミングは、従来のBeamformItビームフォーマーを上回り、LF-MMIとLSTMLMを組み合わせた場合に、WERを3.79%から2.85%に低下させた。
  • 高いSTOIやPESQスコアを示すにもかかわらず、一部のシステムではASR性能が劣化したことが判明し、客観的指標が常にASRの向上を予測するわけではないことが示された(特にSDRスコアが高い場合に顕著)。
  • 強化データの統合が、最適でない強調処理による性能劣化を緩和することを示した。特に、単一マイクロホン設定ではBLSTMマスキングのみでは性能が悪化したが、強化データ拡張を組み合わせることで改善が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。