Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study of Efficient ASR Rescoring with Transformers

Hongzhao Huang, Fuchun Peng|arXiv (Cornell University)|Oct 24, 2019
Topic Modeling参考文献 30被引用数 8
ひとこと要約

本稿では、サブワードトークナイゼーション、アダプティブソフトマックス、大規模事前学習、知識蒸留を組み合わせることで、自動音声認識(ASR)再スコアリングのための効率的で高性能な小規模なトランスフォーマー言語モデルを訓練する手法を提案する。この手法は、GPTモデルと比べて非常に大きなサイズであるにもかかわらず、パラメータの5.5%~11.9%しか使用しないにもかかわらず、相対的語誤り率(WERR)を6.46%~7.17%まで削減し、推論遅延と計算コストを顕著に低減した。

ABSTRACT

Neural language models (LMs) have been proved to significantly outperform classical n-gram LMs for language modeling due to their superior abilities to model long-range dependencies in text and handle data sparsity problems. And recently, well configured deep Transformers have exhibited superior performance over shallow stack of recurrent neural network layers for language modeling. However, these state-of-the-art deep Transformer models were mostly engineered to be deep with high model capacity, which makes it computationally inefficient and challenging to be deployed into large-scale real-world applications. Therefore, it is important to develop Transformer LMs that have relatively small model sizes, while still retaining good performance of those much larger models. In this paper, we aim to conduct empirical study on training Transformers with small parameter sizes in the context of ASR rescoring. By combining techniques including subword units, adaptive softmax, large-scale model pre-training, and knowledge distillation, we show that we are able to successfully train small Transformer LMs with significant relative word error rate reductions (WERR) through n-best rescoring. In particular, our experiments on a video speech recognition dataset show that we are able to achieve WERRs ranging from 6.46% to 7.17% while only with 5.5% to 11.9% parameter sizes of the well-known large GPT model [1], whose WERR with rescoring on the same dataset is 7.58%.

研究の動機と目的

  • ASR再スコアリングに適した、小規模で効率的なトランスフォーマー言語モデルの開発。
  • 認識精度を損なわず、モデルサイズと推論遅延を低減すること。
  • 実世界の応用において最先端のトランスフォーマー言語モデルの大規模な展開を可能にする技術の探求。
  • 知識蒸留と事前学習が小規模モデルの性能向上にどの程度効果を発揮するかの評価。

提案手法

  • モデルサイズの縮小と OOV(未知語)の処理のため、小規模な語彙(5K、10K、25K)を用いたバイトペアエンコーディング(BPE)を採用。
  • 頻出語と希少語に異なる容量を割り当てることで、出力層の計算コストを低減するため、アダプティブソフトマックスを適用。
  • 初期表現学習を向上させるために、大規模なドメイン内テキストで大規模かつ事前学習済みの教師モデルを訓練。
  • ドメイン特化性能を向上させるために、ドメイン内ASRデータで教師モデルをファインチューニング。
  • 知識蒸留を用いて、大規模な教師モデルから小規模な学生モデルへ知識を転送。
  • すべての技術を統合し、n-best再スコアリングで高い性能を達成するコンパクトなトランスフォーマー言語モデルを訓練。

実験結果

リサーチクエスチョン

  • RQ1パラメータ数を削減した小規模なトランスフォーマー言語モデルは、大規模モデルと同等のASR再スコアリング性能を達成できるか?
  • RQ2サブワード単位とアダプティブソフトマックスは、性能を保持したままモデルサイズをどの程度削減できるか?
  • RQ3大規模事前学習と知識蒸留は、ASR再スコアリングにおける小規模モデルの性能向上にどの程度寄与するか?
  • RQ4小規模なトランスフォーマー言語モデルにおいて、モデルサイズ、推論速度、語誤り率削減の間にはどのようなトレードオフがあるか?

主な発見

  • GPTモデルのパラメータの5.5%~11.9%しか使用しない小規模なトランスフォーマー言語モデルが、動画音声認識データセットで相対的語誤り率(WERR)を6.46%~7.17%まで削減した。
  • 5Kまたは10KのBPE語彙をアダプティブソフトマックスと組み合わせることで、小規模モデルのモデルサイズを最大61%まで削減でき、性能の低下は最小限に抑えられた。
  • 事前学習済みでファインチューニング済みの教師モデルからの知識蒸留により、10K語彙では11.8%、5K語彙では12.7%のパープレクサリティ低下が達成され、さらにWERの改善が見られた。
  • 大規模事前学習により、10K語彙では20.7%、5K語彙では12.7%のパープレクサリティ低下が達成され、ドメイン内データでもその有効性が示された。
  • サブワード単位、アダプティブソフトマックス、事前学習、蒸留の組み合わせにより、小規模モデルがはるかに大きなモデルと同等の性能を達成し、計算コストを顕著に低減できた。
  • 5Kまたは10KのBPE語彙を用いた小規模モデルでは、大規模なトランスフォーマー言語モデルと比較してCPU上での推論速度が7.6倍~8.4倍向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。