Skip to main content
QUICK REVIEW

[論文レビュー] Adapting GPT, GPT-2 and BERT Language Models for Speech Recognition

Xianrui Zheng, Chao Zhang|arXiv (Cornell University)|Jul 29, 2021
Speech Recognition and Synthesis参考文献 44被引用数 5
ひとこと要約

本稿では、自動音声認識(ASR)における数学的に正確な文の事前確率を生成するため、双方向言語モデル(例:BERT)の出力を変換する新規手法を提案する。この手法により、GPT や GPT-2 などの単方向モデルと BERT の有効な統合が可能となり、微調整済みの GPT、GPT-2、BERT を組み合わせることで、AMI で最高で相対的に 12%、相対的に 3% の WER 減少を達成した。最良の性能は、最適化された文脈処理と確率変換を組み合わせたハイブリッドモデルによるものである。

ABSTRACT

Language models (LMs) pre-trained on massive amounts of text, in particular bidirectional encoder representations from Transformers (BERT), generative pre-training (GPT), and GPT-2, have become a key technology for many natural language processing tasks. In this paper, we present results using fine-tuned GPT, GPT-2, and their combination for automatic speech recognition (ASR). Unlike unidirectional LM GPT and GPT-2, BERT is bidirectional whose direct product of the output probabilities is no longer a valid language prior probability. A conversion method is proposed to compute the correct language prior probability based on bidirectional LM outputs in a mathematically exact way. Experimental results on the widely used AMI and Switchboard ASR tasks showed that the combination of the fine-tuned GPT and GPT-2 outperformed the combination of three neural LMs with different architectures trained from scratch on the in-domain text by up to a 12% relative word error rate reduction (WERR). Furthermore, on the AMI corpus, the proposed conversion for language prior probabilities enables BERT to obtain an extra 3% relative WERR, and the combination of BERT, GPT and GPT-2 results in further improvements.

研究の動機と目的

  • ドメイン内データ上で微調整することにより、事前学習済みの単方向言語モデル(GPT、GPT-2)と双方向モデル(BERT)を自動音声認識(ASR)に適応させること。
  • BERT の出力確率を直接乗算しても、その双方向的文脈のため、有効な文の事前確率が得られないという課題に対処すること。
  • 双方向言語モデルの出力から、ASR 解釈に適した有効な言語事前確率に変換する数学的に正確な手法を開発すること。
  • ASR の仮説を再スコアリングし、語誤り率(WER)を向上させるために、単方向および双方向言語モデルを統合する性能を評価すること。
  • 微調整済みの事前学習モデルが、ドメイン内データのみで訓練されたニューラル言語モデルを上回ることを示すこと。

提案手法

  • 式 (7) を根拠とする新規な確率変換手法を提案し、BERT の双方向出力から数学的に正確な文の事前確率を計算することで、整合性を保証する。
  • この変換手法を微調整済み BERT に適用し、ASR 解釈パイプラインにおける言語事前確率として統合可能にする。
  • 100 個の最良仮説リストからの左文脈(LC)および右文脈(RC)に加え、必要に応じて参照字幕を用いて、BERT の確率推定のための文脈を強化する。
  • 微調整済みの GPT、GPT-2、BERT を統合するマルチモデル再スコアリング戦略を採用し、線形補間(α = 0.7)によりモデル重みを調整する。
  • 1-best 仮説のキャッシュを用いて BERT の左文脈を提供し、将来の文脈は 1-best または参照仮説を用いてモデル化する。
  • 単方向モデル(GPT、GPT-2)では、デコーダーでマスク付き自己注意機構を用い、BERT のエンコーダーでは完全な自己注意機構を用いる。

実験結果

リサーチクエスチョン

  • RQ1微調整済みの GPT や GPT-2 モデルは、ドメイン内データのみで訓練されたニューラル言語モデルを上回る性能を ASR で示せるか?
  • RQ2BERT のような双方向言語モデルの出力確率を、ASR に適した数学的に有効な文の事前確率に変換することは可能か?
  • RQ3BERT における過去および未来の両方の文脈を組み込むことで、単方向モデルと比較して ASR の性能がどのように向上するか?
  • RQ4ASR の再スコアリングにおいて、単方向(GPT、GPT-2)および双方向(BERT)言語モデルを統合する最適な戦略は何か?
  • RQ5将来の文脈として参照字幕を用いることで、BERT を用いた言語事前確率の品質が向上するか?

主な発見

  • 微調整済みの GPT と GPT-2 モデルの組み合わせにより、AMI 評価セットで 4-gram ベースラインと比較して、最高で相対的に 12% の WER 減少が達成された。
  • AMI コーパスでは、提案された確率変換手法により、BERT がベースライン手法を上回り、相対的に 3% の WER 減少を達成した。これは、本手法の有効性を示している。
  • 左文脈 50 語、右文脈 20 語(1-best 仮説を用いて)を用いた場合、提案手法(M=2)で ADev で 17.0%、AEval で 16.9% の最良 WER を達成した。
  • 1-best 右文脈を参照字幕(20 未来語)に置き換えることで、ADev で 16.8%、AEval で 16.7% に WER がさらに低下し、より高品質な将来文脈の利点が示された。
  • 微調整済みの GPT、GPT-2、BERT の組み合わせにより、ADev で 15.9%、AEval で 15.5% の最低 WER を達成し、単一モデルや二モデルの組み合わせを上回った。
  • M=2 で最適な文脈長を用いた本手法は、最良の MMLM ベースラインと比較して、絶対的に 0.2% の WER 減少を達成し、双方向文脈を効果的に処理できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。