Skip to main content
QUICK REVIEW

[論文レビュー] Acoustic data-driven lexicon learning based on a greedy pronunciation selection framework

Xiaohui Zhang, Vimal Manohar|arXiv (Cornell University)|Jun 12, 2017
Speech Recognition and Synthesis参考文献 16被引用数 5
ひとこと要約

本稿では、音声データからコンパクトで高性能な語彙を学習するため、グラフィムから発音への変換(G2P)と発音デコード出力を統合した、貪欲で尤度に基づく発音候補の刈り込みフレームワークを提案する。逐次的に尤度低下が最小となる候補を削除することで、専門家語彙に近いWER性能を達成し、G2P単体や確率ベースの刈り込み手法を上回る。同時に、単語あたりの平均発音数を約5から1.42に削減する。

ABSTRACT

Speech recognition systems for irregularly-spelled languages like English normally require hand-written pronunciations. In this paper, we describe a system for automatically obtaining pronunciations of words for which pronunciations are not available, but for which transcribed data exists. Our method integrates information from the letter sequence and from the acoustic evidence. The novel aspect of the problem that we address is the problem of how to prune entries from such a lexicon (since, empirically, lexicons with too many entries do not tend to be good for ASR performance). Experiments on various ASR tasks show that, with the proposed framework, starting with an initial lexicon of several thousand words, we are able to learn a lexicon which performs close to a full expert lexicon in terms of WER performance on test data, and is better than lexicons built using G2P alone or with a pruning criterion based on pronunciation probability.

研究の動機と目的

  • 低リソース音声認識における未知語(OOV)語の正確でコンパクトな発音語彙を構築する課題に対処すること。
  • G2Pモデルや確率ベースの刈り込みの限界を克服し、余分で微小な発音変形を過剰に保持するのを防ぐこと。
  • 音声的証拠と発音の多様性を活用して最適な候補を選択するデータ駆動型手法を開発すること。
  • 特に低リソース環境において、ASR性能を損なわず語彙サイズを縮小すること。
  • 尤度ベースの刈り込みが確率ベースやG2P単体のアプローチを上回るWERを達成することを示すこと。

提案手法

  • 小規模な専門家語彙で訓練されたG2Pモデルと、アラインドされた訓練データからの発音デコードによって発音候補を生成する。
  • 各OOV語について、G2Pと発音デコードの候補を統合して語彙を構築する。
  • 音声的証拠を収集するため、音声モデルを用いてラティスから条件付き尤度τ_uwb = p(O_u|w,b)を計算する。
  • 貪欲で尤度低下に基づく刈り込み基準を適用する:語wの全尤度∑_u τ_uwbの低下が最小となる候補bを逐次的に削除する。
  • 得られたコンパクトな語彙をASRデコードに使用し、収束するまで反復的に精緻化する。
  • 公平な比較のため、すべての語彙条件において同一のレシピで音声モデル(SATおよびLF-MMI)を訓練する。
Figure 1: The proposed framework of acoustic-data driven lexicon learning.
Figure 1: The proposed framework of acoustic-data driven lexicon learning.

実験結果

リサーチクエスチョン

  • RQ1尤度ベースの刈り込み基準は、確率ベースの刈り込みよりもOOV語の発音候補選択において優れているか?
  • RQ2G2Pと発音デコードの候補を統合することで、G2P単体に比べて語彙品質が向上するか?
  • RQ31.42(平均発音数/語)というコンパクトな語彙が、完全な専門家語彙に近いWER性能を達成できるか?
  • RQ4提案手法は、G2P拡張および確率ベースの刈り込みベースラインと比較して、WERと語彙サイズの点で優れているか?
  • RQ5限られた訓練データと小さな初期語彙で、本フレームワークは効果的にスケーリングできるか?

主な発見

  • 提案された尤度低下に基づく刈り込み手法により、単語あたりの平均発音数が5.43から1.59に著しく削減され、コンパクト性が向上した。
  • Librispeech-460タスクにおいて、学習語彙はSATで12.06%のWERを達成し、G2P拡張ベースライン(13.72%)と確率ベースの刈り込みベースライン(12.24%)を上回った。
  • SATデコード下で、G2P拡張システムとオラクル専門家語彙との間のWERギャップの88%を埋めた。
  • LF-MMIデコード下では、WERギャップの36%を埋めたことから、モデル訓練基準に頑健であることが示された。
  • 発音デコード候補を候補プールに追加することで、G2P単体に比べ0.82%のWER向上が達成され、多様な候補ソースの重要性が浮き彫りになった。
  • G2P-1bestベースライン(1発音/語)に比べ、学習語彙は相対的に20.9%のWER改善を達成した。これは、コンパクトさが性能低下を意味しないことを証明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。