Skip to main content
QUICK REVIEW

[論文レビュー] SpecAugment on Large Scale Datasets

Daniel Park, Yu Zhang|arXiv (Cornell University)|Dec 11, 2019
Speech Recognition and Synthesis参考文献 26被引用数 4
ひとこと要約

この論文は、スペクトログラムレベルのデータ拡張手法であるSpecAugmentが、GoogleのMultidomain Dataset やLibriSpeech 960h といった大規模な産業用データセットにおいて、エンドツーエンドの自動音声認識(ASR)性能を顕著に向上させることを示している。SpecAugmentをMTR(Multistyle Training)データとの混合により組み合わせることで、2.2%のWER(LibriSpeech test-clean)および5.2%のWER(test-other)という最先端の結果が達成された。計算コストは低く、スケーラビリティにも優れている。

ABSTRACT

Recently, SpecAugment, an augmentation scheme for automatic speech recognition that acts directly on the spectrogram of input utterances, has shown to be highly effective in enhancing the performance of end-to-end networks on public datasets. In this paper, we demonstrate its effectiveness on tasks with large scale datasets by investigating its application to the Google Multidomain Dataset (Narayanan et al., 2018). We achieve improvement across all test domains by mixing raw training data augmented with SpecAugment and noise-perturbed training data when training the acoustic model. We also introduce a modification of SpecAugment that adapts the time mask size and/or multiplicity depending on the length of the utterance, which can potentially benefit large scale tasks. By using adaptive masking, we are able to further improve the performance of the Listen, Attend and Spell model on LibriSpeech to 2.2% WER on test-clean and 5.2% WER on test-other.

研究の動機と目的

  • 公開ベンチマークをはるかに超える大規模・マルチドメインのASRデータセットにおけるSpecAugmentの有効性を評価すること。
  • 産業スケールの環境において、SpecAugmentがMultistyle Training(MTR)のようなより複雑なデータ拡張技術を上回るか、あるいは補完的に機能するかを調査すること。
  • 発話長に応じて調整可能な時間マスクポリシーを検討し、多様な長さの入力に対する一般化性能を向上させること。
  • SpecAugmentが、レイヤー正規化による訓練不安定性の影響を受けるにもかかわらず、ストリーミングASRモデル(特にRNN-Tアーキテクチャ)の性能を向上させることを実証すること。

提案手法

  • 原始音声入力のスペクトログラムに、時間のゆがみ、周波数マスク、時間マスクを含むSpecAugmentを直接適用する。
  • クリーンな訓練データに対して、固定ポリシー(SpecAugBasic)を用い、2つの周波数マスク(F=27)と2つの時間マスク(T=50)を適用し、時間のゆがみは使用しない。
  • 発話長に応じてマスクの数やサイズを変化させるアダプティブ時間マスクを導入し、長時間・短時間のシーケンスにおける一般化性能を向上させる。
  • SpecAugmentedなクリーンデータとMTRで拡張されたデータを8:2の割合で混合し、ドメイン一般化と耐性の両立を図る。
  • レイヤー正規化による勾配不安定性を補うために、マスク領域にガウスノイズを注入することで、ストリーミングRNN-Tモデルの訓練を安定化させる。
  • 自然ドメイン(例:Search, Call, YouTube)およびMTRによる合成ドメイン(例:Search-Noisy)を含む複数のテストセットで訓練および評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1GoogleのMultidomain Dataset のような大規模・マルチドメイン産業用データセットにおいて、SpecAugmentはその性能向上効果を維持するか?
  • RQ2産業スケールのASRにおいて、最先端のデータ拡張手法とされるMultistyle Training(MTR)と比較して、SpecAugmentは性能を上回るか、あるいは補完的に機能するか?
  • RQ3発話長に応じてマスクパラメータが変化するアダプティブ時間マスクは、固定仕様のSpecAugmentに比べて、大規模タスクにおいて性能を向上させるか?
  • RQ4レイヤー正規化による訓練不安定性の影響を受けるにもかかわらず、SpecAugmentはストリーミングASRモデル(特にRNN-T)において測定可能な向上効果を示すか?
  • RQ5性能を多様なテストドメインで最大化するために、SpecAugmentとMTRデータを最適に組み合わせる戦略は何か?

主な発見

  • クリーンデータにSpecAugmentを適用した結果、すべての自然テストセット(例:Search, Call, YouTube)でMTRベースラインを上回り、Searchでは6.2% WER、Callでは4.2% WERを達成した。
  • MTRで拡張されたデータにさらにSpecAugmentを適用すると、大多数のドメインで性能が低下し、両手法間に負の相互作用が生じることが示された。
  • SpecAugmentedなクリーンデータを80%、MTRで拡張されたデータを20%に混合した場合、単体の手法よりもすべてのテストセットでWERが低減し、最良の全体的性能が得られた。
  • LibriSpeech 960hでは、アダプティブ時間マスクを用いたSpecAugmentのバージョンが、テストクリーンで2.2% WER、テストオーサーで5.2% WERまで低下させ、元のSpecAugment論文で報告されたベースライン性能を上回った。
  • 時間マスク単体でも、特にマスク領域にノイズを注入して安定化させた場合、レイヤー正規化を組み合わせたストリーミングRNN-Tモデルにおいて顕著な性能向上が得られた。
  • アダプティブ時間マスクはGoogleのMultidomain Datasetでは固定ポリシーを上回らなかったが、LibriSpeechでは測定可能な向上効果を示し、ドメインに応じたアダプティブ戦略の利点が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。