Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robust Dialog Policies in Noisy Environments

Maryam Fazel-Zarandi, Shang-Wen Li|arXiv (Cornell University)|Dec 11, 2017
Speech and dialogue systems参考文献 27被引用数 19
ひとこと要約

本論文では、騒音環境下での自動音声認識(ASR)および自然言語理解(NLU)エラーからの回復を可能にする、現実的で音声ベースのユーザーサイミュレータを搭載した深層強化学習フレームワークを提案する。サイミュレータは、ノイズを注入した実際の音声データを用いて人間らしい対話を生成し、同じ成功率を達成するが対話回数が少ない、より優れたサンプル効率性と耐障害性を示す対話ポリシーの学習を可能にする。

ABSTRACT

Modern virtual personal assistants provide a convenient interface for completing daily tasks via voice commands. An important consideration for these assistants is the ability to recover from automatic speech recognition (ASR) and natural language understanding (NLU) errors. In this paper, we focus on learning robust dialog policies to recover from these errors. To this end, we develop a user simulator which interacts with the assistant through voice commands in realistic scenarios with noisy audio, and use it to learn dialog policies through deep reinforcement learning. We show that dialogs generated by our simulator are indistinguishable from human generated dialogs, as determined by human evaluators. Furthermore, preliminary experimental results show that the learned policies in noisy environments achieve the same execution success rate with fewer dialog turns compared to fixed rule-based policies.

研究の動機と目的

  • 騒音のある現実世界の音声インタラクションにおいて、人間の対話行動を模倣するユーザーサイミュレータの開発。
  • 深層強化学習を用いて、ASRおよびNLUエラーからの回復が可能な対話ポリシーの学習。
  • 騒音環境下でも高いタスク成功率を維持しつつ、対話長を短縮すること。
  • コーパス固有の語誤り率(WER)を誘発する、現実的な音声レベルのノイズを注入可能なサイミュレータの構築。
  • 固定ルールベースのポリシーと比較して、学習済みポリシーの性能を成功確率および対話効率の観点から評価すること。

提案手法

  • 本研究では、MovieBot Alexaスキルから得た現実世界の対話データを用いて、ユーザーサイミュレータを学習させ、自然で人間らしい会話を生成する。
  • 音声信号に人工的なホワイトノイズを注入することで、現実のASRエラーを模倣し、意図およびスロットレベルのエラーにまで影響を与える現実的な語誤り率(WER)を誘発する。
  • 累積報酬を最大化する対話軌道上で学習するため、深層強化学習(Dueling Double DQN)を用いて対話ポリシーを訓練する。
  • サイミュレータは対話履歴に条件付けられた応答を生成し、ASR/NLUコンponentsの信頼度スコアを用いてポリシー意思決定を支援する。
  • ポリシーは、意図の信頼度と文脈に基づいて、確認、照会、実行などの行動を選び出すように訓練される。
  • ユーザースタディの結果、サイミュレータが生成する対話は、自然さと品質の観点で人間が生成した対話と区別できないことが確認された。

実験結果

リサーチクエスチョン

  • RQ1実際の音声データで学習されたユーザーサイミュレータは、騒音環境下でも人間が生成した対話と区別がつかない対話を生成できるか?
  • RQ2現実的なサイミュレータを用いた深層強化学習により、固定ルールベースのポリシーを上回る性能を示す対話ポリシーが得られるか?
  • RQ3シミュレーションに音声レベルのノイズを組み込むことで、ポリシーの耐障害性とサンプル効率性にどのような影響を与えるか?
  • RQ4学習済みポリシーは、ルールベースシステムと比較して、タスク成功率を維持しつつ対話長をどの程度短縮できるか?
  • RQ5ASR/NLUコンponentsの信頼度スコアは、不要な照会回数を最小限に抑えるために、ポリシーによって効果的に活用できるか?

主な発見

  • ユーザースタディの結果、人間評価者による評価で、サイミュレータが生成する対話は人間が生成した対話と区別がつかないことが確認された。
  • 学習済みの対話ポリシーは、固定ルールベースのポリシーと同等のタスク成功率を達成したが、騒音環境下でははるかに少ない対話回数で実現した。
  • Dueling Double DQNエージェントは、固定ポリシーと比較して不要な照会を39%削減した。また、そのうち82%の照会行動が確認ではなく照会であった。
  • DDQNエージェントはNLUの信頼度が高い場合には照会をスキップするよう学習しており、対話長を短縮するために信頼度スコアを知的に活用していることが示された。
  • サイミュレータは音声レベルのノイズ注入により、現実的なWERを効果的に誘発し、本番環境に近い条件での学習を可能にした。
  • このサイミュレータで訓練されたポリシーは、一般化性能に優れており、高ノイズ環境(SNR = 2.8)下でも成功を維持しつつ、より高い効率性を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。