Skip to main content
QUICK REVIEW

[論文レビュー] Adapting general-purpose speech recognition engine output for domain-specific natural language question answering

C. Anantaram, Sunil Kumar Kopparapu|arXiv (Cornell University)|Oct 12, 2017
Topic Modeling参考文献 9被引用数 4
ひとこと要約

本論文は、一般用途自動音声認識(gp-ASR)出力におけるドメイン固有の誤りを是正する2つの後処理手法——進化的発生(Evo-Devo)と機械学習(ML)——を提案する。Evo-Devo手法は生物学的インスピレーションを受ける修復ルールを用い、ドメイン用語に対して89.3%の正確性を達成する。一方、ML手法は左/右文脈、母音/子音のバッグなどの特徴に基づく分類を用い、ベースライン比で32.28%の正確性向上を達成する。

ABSTRACT

Speech-based natural language question-answering interfaces to enterprise systems are gaining a lot of attention. General-purpose speech engines can be integrated with NLP systems to provide such interfaces. Usually, general-purpose speech engines are trained on large `general' corpus. However, when such engines are used for specific domains, they may not recognize domain-specific words well, and may produce erroneous output. Further, the accent and the environmental conditions in which the speaker speaks a sentence may induce the speech engine to inaccurately recognize certain words. The subsequent natural language question-answering does not produce the requisite results as the question does not accurately represent what the speaker intended. Thus, the speech engine's output may need to be adapted for a domain before further natural language processing is carried out. We present two mechanisms for such an adaptation, one based on evolutionary development and the other based on machine learning, and show how we can repair the speech-output to make the subsequent natural language question-answering better.

研究の動機と目的

  • 企業アプリケーションにおけるドメイン固有用語の認識に、一般用途ASRエンジンの性能が低い問題に対処すること。
  • 下流の自然言語質問応答(NLP)の正確性を低下させるASR出力の誤りを低減すること。
  • 各ドメインごとに再訓練を必要としない柔軟で再利用可能なgp-ASR出力の適合を可能にすること。
  • 2つの異なる適合メカニズム——Evo-Devo(生物学的インスピレーションを受ける修復)と誤ったASR出力のMLベース分類——の評価を行うこと。
  • post-ASR補正が実世界の企業環境におけるQAシステムのパフォーマンスを顕著に向上させることを実証すること。

提案手法

  • Evo-Devo機構はASR出力を生物学的実体とみなして、反復的変異と適合度評価を用いてドメイン用語を修復するルールを適用する。
  • この手法は、修復された文が期待されるドメイン固有の言語パターンとどの程度整合するかを評価する適合度関数を用いる。
  • MLベースの手法は、$({{T^{ ext{'}}, T}})$ペアで訓練された分類器を用いる。ここで、$T^{ ext{'}}$は誤ったASR出力、$T$は正しい参照文である。
  • 特徴には左/右文脈、語数、ASR出力の母音/子音のバッグが含まれ、誤りタイプの分類を支援する。
  • 分類器は10分割交差検証を用いて性能を評価し、最大の正確性向上を達成する特徴の組み合わせを最適化する。
  • システムは、訓練およびテストのための人間による誤りラベルを仮定しており、主に誤認識されたドメイン用語の是正に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1生物学的インスピレーションを受ける進化的発生メカニズムは、企業向けNLPシステムにおけるASR出力のドメイン固有誤りを効果的に是正できるか?
  • RQ2言語的および文脈的特徴を用いた機械学習分類器は、ASR誤りの検出および是正にどの程度効果的か?
  • RQ3どの特徴の組み合わせがASR誤り是正の分類正確性向上に最も寄与するか?
  • RQ4ASRモデルの再訓練なしに、post-ASR適合が下流の質問応答パフォーマンスを顕著に向上させられるか?
  • RQ52つの適合メカニズムは、異なるドメイン固有誤りタイプにおいて、正確性および頑健性の観点でどのように比較できるか?

主な発見

  • Evo-Devo機構はテストセットで89.3%の正確性を達成し、ドメイン用語の是正において優れた性能を示した。
  • MLベースの手法は、子音のバッグ、母音のバッグ、左文脈、語数、右文脈という特徴の組み合わせを用いることで、ベースライン比で32.28%の分類正確性向上を達成した。
  • Evo-Devo手法はドメイン用語に対して高い正確性を示したが、言語的用語のためのルール設計が慎重に行われないと性能低下を招く可能性があった。
  • MLアプローチは文脈的および音声的特徴を活用して誤認識語を特定・是正することで、ベースライン手法を上回った。
  • 両手法ともASR出力の品質を顕著に向上させ、企業向けシステムにおけるより正確な下流の自然言語質問応答を可能にした。
  • 結果は、post-ASR是正が一般用途ASRをドメイン固有の企業アプリケーションに適合させるための実用的で効果的な戦略であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。