Skip to main content
QUICK REVIEW

[論文レビュー] A Bandit Approach to Posterior Dialog Orchestration Under a Budget

Sohini Upadhyay, Mayank Agarwal|arXiv (Cornell University)|Jun 22, 2019
Advanced Bandit Algorithms Research参考文献 19被引用数 12
ひとこと要約

本稿では、スキル実行予算を考慮した後件対話オ케ストレーションのための新規オンラインバンディットアルゴリズム、観察を伴うコンテキストアテンションバンドイット(CABO)を提案する。文脈フィードバックに基づいて動的にどのスキル特徴を公開するかを選択することで、最小限の特徴アクセスでも、事前学習手法および先行の最先端バンディット手法を凌駕する性能を示し、シミュレーテッドおよび実世界の対話設定の両方で優れた結果を達成する。

ABSTRACT

Building multi-domain AI agents is a challenging task and an open problem in the area of AI. Within the domain of dialog, the ability to orchestrate multiple independently trained dialog agents, or skills, to create a unified system is of particular significance. In this work, we study the task of online posterior dialog orchestration, where we define posterior orchestration as the task of selecting a subset of skills which most appropriately answer a user input using features extracted from both the user input and the individual skills. To account for the various costs associated with extracting skill features, we consider online posterior orchestration under a skill execution budget. We formalize this setting as Context Attentive Bandit with Observations (CABO), a variant of context attentive bandits, and evaluate it on simulated non-conversational and proprietary conversational datasets.

研究の動機と目的

  • スキル特徴抽出の予算制約下での効率的な後件対話オーケストレーションの課題に対処すること。
  • ラベル付き学習データを必要とせずに、オンラインで冷スタート可能な対話オーケストレーションのデプロイを可能にすること。
  • 実行コストを考慮しつつ、探索と活用のバランスを取ったスキル特徴選択の手法を開発すること。
  • 定常的および非定常的対話環境の両方で、既存の教師ありおよびバンディットベースの手法を上回ること。
  • ライブでスケーラブルな対話システムに新しいスキルをシームレスに統合できること。

提案手法

  • 対話オーケストレーション問題を、予算下での未知のスキル特徴選択をモデル化する、コンテキストアテンションバンドイット with Observations(CABO)と呼ばれる文脈的バンディット問題の変種として形式化する。
  • 二段階の意思決定プロセスを導入:第一に、クエリと既知のコンテキスト特徴を用いて、どのスキル特徴を実行するかを選択する。第二に、実行後の特徴を観測し、ポリシーを更新する。
  • 応答選択を改善する可能性の高いスキル特徴を優先するコンテキストに配慮した探索戦略を採用し、アーム選択にはトンプソンサンプリングを用いる。
  • 非定常性をモデル化するため、GP-UCBアルゴリズムを変更し、時間経過に伴う報酬関数の変化を考慮した動的予算配分を可能にする。
  • 単一およびインクリメンタルな特徴公開(S=1 と S=U)の両方をサポートし、コストとパフォーマンスの間で柔軟なトレードオフを実現する。
  • シミュレーテッドな非会話的データと、実ユーザーのフィードバックを含む独自の会話データセット(Customer Assistant)を併用したハイブリッド評価設定を採用する。

実験結果

リサーチクエスチョン

  • RQ1オンラインで予算に配慮したバンディットアルゴリズムは、教師ありおよび先行のバンディットベース手法を、後件対話オーケストレーションにおいて上回ることができるか?
  • RQ2異なる予算レベル(すなわち、公開されるスキル特徴の数)において、提案されたCABOアルゴリズムのパフォーマンスはどのように変化するか?
  • RQ3スキルの関連性が時間経過とともに変化する非定常環境でも、アルゴリズムは高いパフォーマンスを維持できるか?
  • RQ4限られた特徴アクセスを伴う後件手法は、事前処理特徴にのみ依存するアプローチをどれだけ上回ることができるか?
  • RQ51つの特徴を一度に公開する(S=1)か、すべてを一度に公開する(S=U)かの選択が、パフォーマンスおよび適応性にどのように影響するか?

主な発見

  • CABOの2つのバージョンであるCATSO-1とCATSO-Uは、定常的および非定常的設定の両方で、全テスト予算において最先端のWTSRCアルゴリズムを上回る性能を示した。
  • わずか2つの公開されたスキル特徴セットですら、後件手法(CATSO-1およびCATSO-U)がアドホックなCTS-queryベースラインを顕著に上回った。
  • 定常的設定では、CATSO-U(インクリメンタルな特徴公開)が、すべてのU(公開される特徴数)の値において、わずかにCATSO-1(同時に公開)を上回った。
  • 非定常的設定では、NCATSO-1(S=1)がわずかにNCATSO-U(S=U)を上回り、3つ以上の特徴が公開された際には、WTSRCおよびCTS-queryをすべて上回った。
  • 本システムは100,000人以上のユーザーに実際にデプロイされ、実ユーザーのフィードバックとエキスパートがラベル付けしたデータを用いて、堅牢な評価が可能になった。
  • 結果から、オンラインで予算に配慮した後件オーケストレーションは、事前学習手法および先行のバンディットベース手法を凌駆するだけでなく、実現可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。