Skip to main content
QUICK REVIEW

[論文レビュー] Lattice-Based Unsupervised Test-Time Adaptation of Neural Network Acoustic Models

Ondřej Klejch, Joachim Fainberg|arXiv (Cornell University)|Jun 27, 2019
Speech Recognition and Synthesis参考文献 39被引用数 6
ひとこと要約

本稿では、lattice-free maximum mutual information (LF-MMI) 学習を用いて、神経ネットワーク音声特徴抽出モデルに対するlatticeベースの教師なしテスト時適応を提案する。単一の最良経路による訳出ではなく、複数の仮説と信頼度スコアを含むlatticeを活用することで、訳出誤りへの過剰適合を低減し、初期のWERが50%を超える状況でも、全モデルパラメータの適応が可能になる。これにより、多様なASRタスクにおいて、最良経路の監視に比べて一貫した性能向上が達成される。

ABSTRACT

Acoustic model adaptation to unseen test recordings aims to reduce the mismatch between training and testing conditions. Most adaptation schemes for neural network models require the use of an initial one-best transcription for the test data, generated by an unadapted model, in order to estimate the adaptation transform. It has been found that adaptation methods using discriminative objective functions - such as cross-entropy loss - often require careful regularisation to avoid over-fitting to errors in the one-best transcriptions. In this paper we solve this problem by performing discriminative adaptation using lattices obtained from a first pass decoding, an approach that can be readily integrated into the lattice-free maximum mutual information (LF-MMI) framework. We investigate this approach on three transcription tasks of varying difficulty: TED talks, multi-genre broadcast (MGB) and a low-resource language (Somali). We find that our proposed approach enables many more parameters to be adapted without over-fitting being observed, and is successful even when the initial transcription has a WER in excess of 50%.

研究の動機と目的

  • 誤りを含む最初のパスの訳出を用いた神経ネットワーク音声特徴抽出モデルの教師なしテスト時適応における過剰適合の課題に対処すること。
  • 信頼度や混乱情報が欠落する最良経路の監視の限界を克服し、初期WERが高い場合に劣悪な適応が生じるのを防ぐこと。
  • latticeベースの監視が、事前のパラメータの削減や正則化を要せず、すべてのモデルパラメータの信頼性ある適応を可能にするかを検討すること。
  • 標準的手法が失敗する低リソースおよび高不一致ASR状況において、lattice監視の有効性を実証すること。
  • 初期モデル性能が低い状況でも、latticeベースの適応がLHUCなどの従来手法を上回るかを調査すること。

提案手法

  • 単一の最良経路に依存するのではなく、最初のパスデコードから得られるlatticeを、判別的適応の全監視として使用する。
  • lattice-free maximum mutual information (LF-MMI) 目的関数を用いて、latticeに含まれるすべての仮説を活用して音声特徴抽出モデルを学習し、訳出誤りに対するロバスト性を向上させる。
  • lattice監視を用いて、ニューラルネットワーク音声特徴抽出モデルのすべてのパラメータを適応させ、パラメータの削減や低ランク制約の必要性を回避する。
  • 語の信頼度や発音の混乱情報をlattice情報として活用し、適応プロセスをガイドすることで過剰適合を低減する。
  • latticeベースの適応をLF-MMIフレームワークに統合し、不確実性を考慮した監視によるエンドツーエンドの判別的学習を可能にする。
  • 信頼度に基づくフィルタリングをベースライン比較として用いるが、lattice監視がそのようなフィルタリングへの依存を低減することを示す。

実験結果

リサーチクエスチョン

  • RQ1初期の最初のパス訳出のWERが高く(例:50%以上)ても、latticeベースの監視が教師なしテスト時適応を改善できるか?
  • RQ2最良経路ではなくlatticeを使用することで、全ニューラルネットワークモデルの適応において、一般化性能が向上し、過剰適合が低減するか?
  • RQ3パラメータ制限付き手法(例:LHUC)と比較して、latticeベースの適応は性能とロバスト性の面で優れているか?
  • RQ4初期モデルが適応が不十分な状況(例:ソマリ語ASRのような低リソース環境)においても、latticeベースの適応が有効か?
  • RQ5最良経路手法と比較して、lattice監視は信頼度に基づく適応データのフィルタリングの必要性を低減できるか?

主な発見

  • latticeベースの適応は、初期WERが50%を超える状況でも、最良経路の監視に比べて0.7–0.8%の絶対的WER改善を達成する。
  • 信頼度に基づくフィルタリングを用いた最良経路適応でさえ、latticeを用いた適応が優れていることが判明し、特にWERが高い状況で顕著である。
  • 初期WERが57.3%のソマリ語モデルでは、latticeベースの適応によって劣化が生じず、最良経路適応では性能が悪化した。
  • latticeを用いた全モデル適応は、パラメータ効率の良い適応の強力なベースラインであるLHUCに基づく適応を上回る結果を示した。
  • 信頼度に基づくフィルタリングは、lattice監視ではあまり有効ではなく、latticeが信頼度単体よりも本質的にロバストな監視を提供していることを示している。
  • 本手法は、低リソースおよび高不一致環境でも、過剰適合を避けてすべてのモデルパラメータを信頼性高く適応可能にし、latticeベースの監視の優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。