Skip to main content
QUICK REVIEW

[論文レビュー] Frustratingly Easy Noise-aware Training of Acoustic Models

Desh Raj, Jesús Villalba|arXiv (Cornell University)|Nov 4, 2020
Speech Recognition and Synthesis参考文献 28被引用数 4
ひとこと要約

本稿では、事前学習済みGMM-HMMアライメントを用いて、音声フレームとサイレントフレームの平均から得られる発話単位のノイズベクトルを用いる、計算コストを増加させないノイズに配慮した学習手法を提案する。この手法により、AMIおよびAurora-4データセットで相対的に6–7%のWER改善が達成され、従来の埋め込みベースのベースラインを上回り、フレーム単位の最尤推定を用いたノイズベクトルの推定により、オンラインストリーミングASRが可能になる。

ABSTRACT

Environmental noises and reverberation have a detrimental effect on the performance of automatic speech recognition (ASR) systems. Multi-condition training of neural network-based acoustic models is used to deal with this problem, but it requires many-folds data augmentation, resulting in increased training time. In this paper, we propose utterance-level noise vectors for noise-aware training of acoustic models in hybrid ASR. Our noise vectors are obtained by combining the means of speech frames and silence frames in the utterance, where the speech/silence labels may be obtained from a GMM-HMM model trained for ASR alignments, such that no extra computation is required beyond averaging of feature vectors. We show through experiments on AMI and Aurora-4 that this simple adaptation technique can result in 6-7% relative WER improvement. We implement several embedding-based adaptation baselines proposed in literature, and show that our method outperforms them on both the datasets. Finally, we extend our method to the online ASR setting by using frame-level maximum likelihood for the mean estimation.

研究の動機と目的

  • DNNベースの音声認識モデルのノイズ環境下での耐性を向上させつつ、学習の複雑さを増さないことを目的とする。
  • GMM-HMMアライメントを再利用することで、低コストで効果的なノイズに配慮した学習技術を開発することを目的とする。
  • フレーム単位の最尤推定を用いて、ストリーミングフレーム上でリアルタイムにノイズベクトル推定を行うことで、オンラインストリーミングASRを実現することを目的とする。
  • iベクトルやeベクトルのような既存の埋め込みベースの適応手法を上回る、ノイズに強い音声認識性能を達成することを目的とする。

提案手法

  • 発話単位における音声フレームとサイレントフレームの平均を、事前学習済みGMM-HMMアライメントから得たSADラベルを用いて計算する。
  • これらのノイズベクトルを入力特徴に付加することで、DNNがノイズ耐性を向上させる非線形変換を学習可能にする。
  • オンラインASRのため、ノイズベクトルの平均を、ストリーミングフレーム上で最尤推定を用いた確率的モデルで推定する。
  • 音声およびノイズ成分のスケーリング要因はEM最適化により学習され、フレームが観測されない場合にはグローバル統計またはデフォルト値で初期化される。
  • この手法はフロントエンド信号処理を回避し、構造的な入力条件付けにより、音声認識モデルに直接ノイズ認識能力を統合する。
  • 同じアライメントを音声認識モデルの学習に用いるため、lattice-free MMIなどの系列判別的学習基準とも互換性がある。

実験結果

リサーチクエスチョン

  • RQ1音声フレームとサイレントフレームの平均から得られる単純で計算コストが低いノイズベクトルは、音声認識モデルの耐性を向上させることができるか?
  • RQ2このノイズに配慮した学習アプローチは、iベクトルやeベクトルのような既存の埋め込みベースの適応手法を上回るか?
  • RQ3全発話を待たずに、ストリーミングASRに適応可能なノイズベクトル推定が可能か?
  • RQ4本手法の性能は、広範なデータ拡張を伴う多条件学習と比較してどうなるか?

主な発見

  • 提案手法は、ベースラインモデルと比較してAMIおよびAurora-4データセットで相対的に6–7%のWER向上を達成した。
  • iベクトルやeベクトルといった確立されたベースラインを上回り、環境歪みへの一般化性能が優れていることが示された。
  • 音声およびサイレントフレームの平均を用いたノイズベクトル推定は、開始/終了フレームのみを用いる従来の手法よりもより情報量の多いノイズ表現を提供する。
  • フレーム単位の最尤推定を用いたオンライン適応バージョンにより、最小限の遅延でリアルタイムなノイズに配慮した推論が可能になった。
  • 標準的なGMM-HMMアライメントに追加で計算コストをかけないため、大規模な展開において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。