Skip to main content
QUICK REVIEW

[論文レビュー] Improving Noise Robustness of an End-to-End Neural Model for Automatic Speech Recognition

Jagadeesh Balam, Jocelyn Huang|arXiv (Cornell University)|Oct 23, 2020
Speech Recognition and Synthesis参考文献 23被引用数 5
ひとこと要約

この論文は、リババーブレーション、バックグラウンドノイズ、低レートコーデックを含む強力なデータ拡張を用いて事前学習済みのエンドツーエンドASRモデルをファインチューニングすることで、クリーン音声性能を損なうことなくノイズ耐性を向上させる手法を提案している。この手法は、遠方音声、混合サンプリングレート、低ビットレートコーデックを含む多様なノイズ環境において顕著なWER低減を達成しており、NeMoでモデルとトレーニングレシピをオープンソース化している。

ABSTRACT

We present our experiments in training robust to noise an end-to-end automatic speech recognition (ASR) model using intensive data augmentation. We explore the efficacy of fine-tuning a pre-trained model to improve noise robustness, and we find it to be a very efficient way to train for various noisy conditions, especially when the conditions in which the model will be used, are unknown. Starting with a model trained on clean data helps establish baseline performance on clean speech. We carefully fine-tune this model to both maintain the performance on clean speech, and improve the model accuracy in noisy conditions. With this schema, we trained robust to noise English and Mandarin ASR models on large public corpora. All described models and training recipes are open sourced in NeMo, a toolkit for conversational AI.

研究の動機と目的

  • 多様な現実世界の音響環境に一般化可能なノイズ耐性を持つエンドツーエンドASRモデルの開発。
  • ノイズ多発、低SNR、低ビットレート環境下での性能向上を維持しつつ、クリーン音声の高精度を保つこと。
  • オンラインデータ拡張を用いたファインチューニングが、ノイズ耐性向上のための効率的でスケーラブルな手法であることを示すこと。
  • 公開データセットを用いてトレーニングされた、英語および中国語用の大規模なオープンソースASRモデルの提供。

提案手法

  • LibriSpeech、Common Voice、WSJ、Fisher、Switchboard、AISHELL-2を含む大規模なクリーン音声データセットを用いて、エンドツーエンドASRモデル(QuartzNet)を事前学習する。
  • ランダム確率 $ P_{aug} $ を用いたオンラインデータ拡張を用いて、事前学習済みモデルをファインチューニングし、リバーブレーション、前方音声およびバックグラウンドノイズをさまざまなSNRで適用する。
  • AMR-NBおよびOgg Vorbisを用いたコーデック拡張を実施し、低ビットレート(例:4.75–7.4 kbpsおよび25–48 kbps)で電話通話および帯域制限を模擬する。
  • OpenSLRおよびBUT ReverbDBの実際およびシミュレートされた部屋インパulse応答(RIR)を用いて、ファインチューニング中に遠方音声の音響をモデル化する。
  • ハイパーパrameterを用いて拡張の強度を制御:RIR適用のための $ P_{rir} $ と、SNR範囲(前方音声:0–30 dB、バックグラウンドノイズ:10–40 dB)。
  • クリーン性能とノイズ耐性のバランスを最適化するため、$ P_{aug} = 0.3 $ から $ 0.5 $ を最適と判断する。

実験結果

リサーチクエスチョン

  • RQ1強力なデータ拡張を用いたファインチューニングが、クリーン音声性能を損なうことなく、多様なノイズ環境下でのエンドツーエンドASRの耐性を向上させることができるか?
  • RQ2拡張確率 $ P_{aug} $ の選択が、クリーン音声とノイズ環境下での精度のトレードオフにどのように影響するか?
  • RQ3多様な拡張を用いてファインチューニングされた1つのモデルが、遠方音声、混合サンプリングレート、低ビットレートコーデックに効果的に一般化できるか?
  • RQ4VOiCESコーパスに含まれる実世界のノイズ源でテストした場合、モデルの性能がどの程度維持されるか?

主な発見

  • ノイズ耐性モデル(QN-En-NR)は、ベースモデルと比較してD105遠方音声テストセットで66%の相対的WER低減を達成した一方、クリーンテストセットでのWERはわずか3.1%上昇にとどまった。
  • $ P_{aug} = 0.3 $ の場合、LibriSpeechテストクリーンでWERが3.86%を維持しながら、ノイズ環境下でのWERをベースモデルと比較して最大40%まで低減した。
  • 8 kHz音声において、中国語モデルのWERは、混合サンプリングレート拡張を用いたファインチューニング後、12.35%から7.48%に低下し、帯域制限に対する強い耐性を示した。
  • 低SNR環境下でも一貫した改善が見られた:8 kHzノイズを含むHub5 SWBでは、4.75 kbps AMR-NBコーデックでWERが14.0%から13.1%に低下した。
  • VOiCESノイズ(0 dB SNR)を含むLibriSpeechテストクリーンで、ノイズ耐性モデルは4.56%のWERを達成したのに対し、ベースモデルは4.96%であった。低SNR環境下での耐性向上が確認された。
  • $ P_{aug} = 1 $ でトレーニングしたモデルは、テストクリーンでWERが72.91%に急激に上昇し、過剰な拡張がクリーン性能に悪影響を及えることを確認した。最適な $ P_{aug} $ は約0.3–0.5であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。