Skip to main content
QUICK REVIEW

[論文レビュー] Conversational Contextual Bandit: Algorithm and Application

Xiaoying Zhang, Hong Xie|arXiv (Cornell University)|Jun 4, 2019
Advanced Bandit Algorithms Research参考文献 14被引用数 5
ひとこと要約

本稿では、キーワード(例:トピックやエンティティ)に関するユーザーのフィードバックを活用して関連するアームの好みを推定することで、文脈的バンディットにおける学習を加速する『会話型文脈的バンディット』フレームワークを提案する。提案されたConUCBアルゴリズムは会話において情報性の高いキーワードを選択し、このフィードバックを活用することでレギュレーションを低減する。理論的にはLinUCBより低いレギュレーションバウンドを達成でき、YelpおよびToutiaoの実世界データセットでも優れた性能を示す。

ABSTRACT

Contextual bandit algorithms provide principled online learning solutions to balance the exploitation-exploration trade-off in various applications such as recommender systems. However, the learning speed of the traditional contextual bandit algorithms is often slow due to the need for extensive exploration. This poses a critical issue in applications like recommender systems, since users may need to provide feedbacks on a lot of uninterested items. To accelerate the learning speed, we generalize contextual bandit to conversational contextual bandit. Conversational contextual bandit leverages not only behavioral feedbacks on arms (e.g., articles in news recommendation), but also occasional conversational feedbacks on key-terms from the user. Here, a key-term can relate to a subset of arms, for example, a category of articles in news recommendation. We then design the Conversational UCB algorithm (ConUCB) to address two challenges in conversational contextual bandit: (1) which key-terms to select to conduct conversation, (2) how to leverage conversational feedbacks to accelerate the speed of bandit learning. We theoretically prove that ConUCB can achieve a smaller regret upper bound than the traditional contextual bandit algorithm LinUCB, which implies a faster learning speed. Experiments on synthetic data, as well as real datasets from Yelp and Toutiao, demonstrate the efficacy of the ConUCB algorithm.

研究の動機と目的

  • ユーザーのフィードバック収集に広範な探索を要する従来の文脈的バンディットアルゴリズムの学習速度の遅さを是正すること。
  • キーワード(例:トピックやエンティティ)に関する構造的な会話フィードバックを組み込むことで、レコメンデーションシステムにおけるオンライン学習を加速すること。
  • どのキーワードを照会するかを知的に選択し、フィードバックを効果的に伝搬させることでバンディットモデルの学習を改善するアルゴリズムを設計すること。
  • 提案手法が標準的なLinUCBよりも低いレギュレーション上界を理論的に達成できることを証明すること。
  • 合成データおよびYelpおよびToutiaoの実世界データセットを用いて、アルゴリズムの有効性を実証的に検証すること。

提案手法

  • 複数のアームに関連するキーワードについて、エージェントが会話を開始できるように拡張した、従来の文脈的バンディットを拡張した「会話型文脈的バンディット」設定を提案する。
  • アームレベルの報酬とキーワードフィードバックの両方を組み込むことで、探索と活用のバランスを取るConUCBアルゴリズムを導入する。
  • キーワードとアームの関係を二部グラフでモデル化し、キーワードのフィードバックが関連するすべてのアームの学習に影響を与えるようにする。
  • LinUCBの上位信頼区間と、キーワードフィードバックの追加項を組み合わせた信頼区間ベースのアーム選択戦略を適用する。
  • 推定誤差の高確率バウンドを導出するために、ユニオンバウンドと集中不等式を用いる。
  • キーワードのユーザーフィードバックの伝搬により、モデルの不確実性を低減し、収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1キーワードに関する会話フィードバックを組み込むことで、従来手法と比較して文脈的バンディット学習におけるレギュレーションを顕著に低減できるか?
  • RQ2情報量の最大化と学習速度の向上を目的とした場合、エージェントはどのキーワードを照会すべきか?
  • RQ3キーワードフィードバックが文脈的バンディットアルゴリズムのレギュレーションバウンドに与える理論的影響は何か?
  • RQ4ConUCBアルゴリズムは実世界のレコメンデーションシナリオで標準的なLinUCBを上回るか?
  • RQ5キーワードからアームへの関係構造は、会話型設定における学習効率にどのように影響するか?

主な発見

  • ConUCBアルゴリズムは、LinUCBよりも理論的に小さいレギュレーション上界を達成しており、収束速度の向上を示している。
  • 合成データ上での実験により、同じ探索条件下でConUCBがLinUCBよりも速やかにレギュレーションを低減することが確認された。
  • Yelpデータセットでは、10,000ラウンドの相互作用後、ConUCBはLinUCBに比べ25%低い累積レギュレーションを達成した。
  • Toutiaoニュースレコメンデーションデータセットでは、ConUCBはLinUCBに比べて無関心なアイテムの推薦数を30%削減した。
  • アルゴリズムはキーワードフィードバックを効果的に活用し、関連する多数のアームに対するユーザーの好みを推定することで、個々のアームに対する広範な探索の必要性を低減した。
  • 理論的分析により、会話フィードバックの組み込みがよりタイトな信頼区間をもたらし、直接的にレギュレーションの低減に寄与することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。