Skip to main content
QUICK REVIEW

[論文レビュー] Towards Personalized Dialog Policies for Conversational Skill Discovery

Maryam Fazel-Zarandi, Sampat Biswas|arXiv (Cornell University)|Nov 15, 2019
Speech and dialogue systems参考文献 33被引用数 4
ひとこと要約

本論文では、音声アシスタントにおけるパーソナライズド・スキル発見のための強化学習(RL)ベースの対話エージェントを提案する。ルールベースのシステムに比べ、ユーザーの属性(例:初回利用者 vs. 再度利用者)および対話スタイル(例:簡潔 vs. 詳細)に適応することで、パーソナライズ化と効率性を向上させる。実際のプロダクション環境での評価において、RLエージェントは平均4.65ターンで76.99%の成功率を達成し、ルールベースのエージェント(73.41%の成功、4.97ターン)を顕著に上回り、パーソナライズ化と効率性の両面で優れた性能を示した。

ABSTRACT

Many businesses and consumers are extending the capabilities of voice-based services such as Amazon Alexa, Google Home, Microsoft Cortana, and Apple Siri to create custom voice experiences (also known as skills). As the number of these experiences increases, a key problem is the discovery of skills that can be used to address a user's request. In this paper, we focus on conversational skill discovery and present a conversational agent which engages in a dialog with users to help them find the skills that fulfill their needs. To this end, we start with a rule-based agent and improve it by using reinforcement learning. In this way, we enable the agent to adapt to different user attributes and conversational styles as it interacts with users. We evaluate our approach in a real production setting by deploying the agent to interact with real users, and show the effectiveness of the conversational agent in helping users find the skills that serve their request.

研究の動機と目的

  • 大規模な音声アシスタントにおいて、数千ものスキルの中から関連するスキルを見つけるのが困難であるという課題に対処すること。
  • ユーザーの属性と対話の好みに基づいて対話をパーソナライズすることで、スキル発見の質を向上させること。
  • 強化学習を用いて、ユーザー行動に応じて動的に適応する対話ポリシーを設計し、静的ルールベースのシステムを凌駕すること。
  • 実際のプロダクション環境でリアルユーザーを対象に、RLベースのエージェントの有効性を評価すること。
  • パーソナライズドで適応可能な対話ポリシーが、より高い成功確率と短い対話回数を実現することを示すこと。

提案手法

  • 音声アシスタントにおけるスキル発見のベースラインとして、ルールベースの対話エージェントを採用する。
  • ユーザーのフィードバックをスパarsな報酬として用い、成功確率と対話長の両方を最適化する強化学習(RL)エージェントを訓練する。
  • RL環境における状態特徴として、ユーザー属性(例:初回利用者 vs. 再度利用者)および対話スタイル(例:簡潔 vs. 詳細)を組み込む。
  • ユーザーの文脈、履歴、好みを含む状態空間と、おすすめ、情報要求、ナビゲーション操作をカバーする行動空間を定義する。
  • 深層Qネットワーク(DQN)や類似のRLアルゴリズムを用い、対話ターンにわたる累積報酬を最大化するポリシーを学習する。
  • 訓練済みのRLエージェントを実際のプロダクション環境にデプロイし、ルールベースのベースラインと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1強化学習ベースの対話ポリシーは、音声アシスタントの実世界におけるスキル発見で、ルールベースのポリシーを上回ることができるか?
  • RQ2ユーザー属性(例:初回利用者 vs. 再度利用者)に基づくパーソナライズは、対話の成功と効率にどのような影響を及ぼすか?
  • RQ3対話スタイル(例:簡潔 vs. 詳細)に適応することは、ユーザー満足度とタスク完了にどの程度寄与するか?
  • RQ4RLエージェントは、成功確率を維持または向上させつつ、対話の長さを短縮する能力を学習できるか?
  • RQ5ドメインに依存しないパーソナライズド対話ポリシーは、スケールしたプロダクション環境で効果的に訓練およびデプロイ可能か?

主な発見

  • RLベースのエージェントは76.99%の成功確率を達成し、ルールベースのエージェントの73.41%を顕著に上回った(p < 0.0001)。
  • RLエージェントは平均対話長を4.65ターンに短縮したが、ルールベースのエージェントは4.97ターンであった(p < 0.0001)。
  • 初回利用者(77.14% vs. 72.68%)および再度利用者(76.76% vs. 74.49%)の両方において、RLポリシーがルールベースのポリシーを上回った。両者の差は有意であった(p < 0.0001)。
  • ルールベースのポリシーは初回利用者と再度利用者の間で顕著な性能差を示した(p = 0.0010)ことから、再度利用者に偏っていることが示された。一方、RLポリシーは両グループの性能をバランスさせた。
  • RLエージェントはユーザー属性および対話スタイルに適応し、実世界環境におけるパーソナライズド・ポリシーの学習の有効性を実証した。
  • 本研究は、対話全体を最適化する(RLを用いて)ことで、成功確率と効率性の両面で測定可能な改善が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。