Skip to main content
QUICK REVIEW

[論文レビュー] end-to-end training of a large vocabulary end-to-end speech recognition system

Chanwoo Kim, Sung-Soo Kim|arXiv (Cornell University)|Dec 22, 2019
Speech Recognition and Synthesis参考文献 51被引用数 9
ひとこと要約

本論文は、CPU-GPUクラスタを用いて、声帯路長の摂動(VTLP)と音響シミュレーションを活用したデータ拡張を実行する、スケーラブルでオンザフライなエンドツーエンド音声認識学習フレームワークを提示する。BFAモデルにスパarsely融合された言語モデルを用いて、LibriSpeechのテストクリーンデータセットで2.44%のWERを達成し、独自のBixbyデータセットで7.92%のWERを記録した。これは、ニアフィールドおよびファーアイルドの両状況において、最先端の性能を示している。

ABSTRACT

In this paper, we present an end-to-end training framework for building state-of-the-art end-to-end speech recognition systems. Our training system utilizes a cluster of Central Processing Units(CPUs) and Graphics Processing Units (GPUs). The entire data reading, large scale data augmentation, neural network parameter updates are all performed "on-the-fly". We use vocal tract length perturbation [1] and an acoustic simulator [2] for data augmentation. The processed features and labels are sent to the GPU cluster. The Horovod allreduce approach is employed to train neural network parameters. We evaluated the effectiveness of our system on the standard Librispeech corpus [3] and the 10,000-hr anonymized Bixby English dataset. Our end-to-end speech recognition system built using this training infrastructure showed a 2.44 % WER on test-clean of the LibriSpeech test set after applying shallow fusion with a Transformer language model (LM). For the proprietary English Bixby open domain test set, we obtained a WER of 7.92 % using a Bidirectional Full Attention (BFA) end-to-end model after applying shallow fusion with an RNN-LM. When the monotonic chunckwise attention (MoCha) based approach is employed for streaming speech recognition, we obtained a WER of 9.95 % on the same Bixby open domain test set.

研究の動機と目的

  • 大規模かつ多様な音声データを処理できる、スケーラブルで分散型のエンドツーエンド音声認識学習システムの開発。
  • 効果的なデータ拡張技術を用いて、ファーアイルドおよびノイジー環境における耐性を向上させること。
  • 標準的および独自の音声認識ベンチマークで、最先端の語誤り率(WER)を達成すること。
  • CPU-GPUクラスタを用いた効率的なオンザフライでのデータ拡張およびモデル学習処理を可能にすること。
  • VTLPと音響シミュレーションの組み合わせが、発話者および環境的変動にどのように寄与するかを実証すること。

提案手法

  • システムはCPUとGPUのクラスタを用い、tf.dataとシャーディッドTFRecordsを用いた例サーバーにより、オンザフライでデータ処理、拡張、特徴抽出が実行される。
  • 発話者変動を模倣するためにボーカルトレイクト・レンジ・ペルトゥルベーション(VTLP)が適用され、音響シミュレータにより、異なる部屋のインパulse応答とノイズ条件を伴うリアルなファーアイルド音声が生成される。
  • ニューラルネットワークのパラメータは、Adam最適化法を用いたHorovod allreduceフレームワークにより更新され、GPUノード間での効率的な分散学習が可能になる。
  • 音響シミュレーションパラメータの事前計算を回避し、代わりに学習中に動的に生成することで、ストレージを削減し、柔軟性を向上させる。
  • テストセットでのデコード性能向上のため、TransformerとRNN言語モデルを用いたシャロウ融合が適用される。
  • 信号強化としてニューラルビームフォーマー(NBF)がデータ拡張と併用され、ファーアイルド認識精度のさらなる向上が図られる。
(a)
(a)

実験結果

リサーチクエスチョン

  • RQ1分散学習とオンザフライでのデータ拡張を用いた完全なエンドツーエンド音声認識システムは、大規模かつ多様な音声データセットで最先端の性能を達成できるか?
  • RQ2VTLPと音響シミュレーションは、発話者変動およびファーアイルド音響条件に対する耐性向上にどの程度有効か?
  • RQ3高度な言語モデルとデータ拡張を組み合わせた場合、語誤り率の低減にどのような影響を与えるか?
  • RQ4ファーアイルドおよびオープンドメインの設定において、エンドツーエンドモデルの性能は従来のWFSTベースのシステムと比べてどうか?
  • RQ5同じ拡張済み学習データを、ノイズやリバーブに強い性能を維持したまま、ニアフィールドおよびファーアイルドの両方の音声認識に効果的に使用できるか?

主な発見

  • エンドツーエンドシステムは、Transformer言語モデルを組み合わせたBFAモデルを用いて、LibriSpeechのテストクリーンセットで2.44%のWERを達成し、以前の最先端の結果を上回った。
  • 独自のBixbyオープンドメインテストセットでは、RNN-LMへのシャロウ融合を施したBFAモデルを用いて7.92%のWERを達成し、従来のWFSTベースのシステムと比較して10%の相対的改善を示した。
  • ストリーミング推論において、MoChAベースのモデルは同じBixbyテストセットで9.95%のWERを達成し、リアルタイム制約下でも優れた性能を示した。
  • VTLPと音響シミュレーションの併用により、ファーアイルド条件での認識精度が顕著に向上し、さらにニューラルビームフォーマー(NBF)と組み合わせることで追加の利点が得られた。
  • オンザフライでのデータ処理パイプラインは、クリーンなデータでも高い性能を維持しながら、ノイズやリバーブに対する耐性を高め、環境に応じた柔軟性の高さを実証した。
  • Horovodベースのallreduce学習フレームワークにより、マルチGPUクラスタを活用した大規模モデル最適化が効率的に行えるようになった。
(b)
(b)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。