Skip to main content
QUICK REVIEW

[論文レビュー] Combinatorial Cascading Bandits

Branislav Kveton, Zheng Wen|arXiv (Cornell University)|Jul 15, 2015
Advanced Bandit Algorithms Research参考文献 9被引用数 13
ひとこと要約

本稿は、組み合わせ的行動、非線形報酬関数、部分的観測を伴うオンライン学習のための新しい部分観測フレームワーク「組み合わせ的カスケードバンディット」を導入する。非線形報酬と部分的観測に対処するため、個々のアイテムの上側信頼区間(UCB)の積を最大化するというアプローチを採用した、UCBに類似したアルゴリズム ${\tt CombCascade}$ を提案する。この手法により、ギャップ依存およびギャップフリーのレギュレートバウンドを達成し、従来の確率的組み合わせ的バンディットに関する先行研究を一般化する。

ABSTRACT

We propose combinatorial cascading bandits, a class of partial monitoring problems where at each step a learning agent chooses a tuple of ground items subject to constraints and receives a reward if and only if the weights of all chosen items are one. The weights of the items are binary, stochastic, and drawn independently of each other. The agent observes the index of the first chosen item whose weight is zero. This observation model arises in network routing, for instance, where the learning agent may only observe the first link in the routing path which is down, and blocks the path. We propose a UCB-like algorithm for solving our problems, CombCascade; and prove gap-dependent and gap-free upper bounds on its $n$-step regret. Our proofs build on recent work in stochastic combinatorial semi-bandits but also address two novel challenges of our setting, a non-linear reward function and partial observability. We evaluate CombCascade on two real-world problems and show that it performs well even when our modeling assumptions are violated. We also demonstrate that our setting requires a new learning algorithm.

研究の動機と目的

  • 組み合わせ的行動、非線形報酬関数(アイテム重みの論理積)および部分的フィードバック(最初の重み0のアイテムのみが観測される)を伴うオンライン学習問題をモデル化・解決すること。
  • 均一マトロイドに制限されない任意の可能な集合に対して適応可能な、計算的に効率的な学習アルゴリズムの開発。
  • 部分的観測と非線形報酬の下で、提案されたアルゴリズムに対する理論的レギュレートバウンド(ギャップ依存およびギャップフリー)の確立。
  • ${\tt CombCascade}$ がモデル仮定が満たされない状況でも、${\tt CombUCB1}$ より優れた性能を示すことを実験的に示すこと。
  • 標準的なUCBベースのアルゴリズムは、非線形報酬と部分的フィードバックの下ではこの設定で失敗するため、新たなアルゴリズム的アプローチの必要性を示すこと。

提案手法

  • 問題を $B = (E, P, \Theta)$ という組み合わせ的カスケードバンディットとして形式化し、$E$ は $L$ 個の基本アイテムの集合、$P$ は二値重みに関するi.i.d.分布、$\Theta$ は相異なるアイテムのタプルの任意の可能な集合である。
  • 報酬を $\mathbf{r}_t = \bigwedge_{e \in \mathbf{A}_t} \mathbf{w}_t(e)$ と定義する。これは、選択された解に含まれるすべてのアイテムの重みが1のときにのみ1となる。
  • ${\tt CombCascade}$ を導入する。これは、個々のアイテムのUCBの「積」に基づいて解を選択するUCBに類似したアルゴリズムであり、${\tt CombUCB1}$ がそれらの和に基づくのとは対照的である。
  • 期待重みが1以下に有界であることに着目した、レギュレート解析に不可欠な修正されたUCB上側信頼区間を用いる。
  • 非線形報酬と部分的観測を扱うために、最近の確率的組み合わせ的セミバンディットに関する研究を拡張する、非最適なアイテム選択回数を数えるという新しい解析技術を採用する。
  • ギャップ依存およびギャップフリーのレギュレートバウンドを導出する。ギャップ依存バウンドは $O(\sum_{i \in \text{suboptimal}} \frac{\log n}{\Delta_i})$ に比例し、ギャップフリーのバウンドは $O(\sqrt{K \log n})$ である。ここで $K$ は最大解のサイズを表す。

実験結果

リサーチクエスチョン

  • RQ1非線形報酬関数と部分的フィードバックを伴う組み合わせバンディットに対して、UCBベースのアルゴリズムを設計し、理論的解析を行うことは可能か?
  • RQ2UCBの「和」ではなく「積」を最大化することで、非マトロイドな可能な集合において、より優れた性能とレギュレートバウンドが達成できるか?
  • RQ3i.i.d.および独立な重み仮定が満たされない状況でも、${\tt CombCascade}$ は実際の性能を示せるか?
  • RQ4非線形報酬と部分的フィードバックを伴う設定では、${\tt CombUCB1}$ らような既存のアルゴリズムが、単純な状況では成功するが、この設定では失敗する可能性があるか?
  • RQ5このクラスの問題におけるレギュレートの理論的限界は何か?また、バウンドに現れる $f^*$ 因子は本質的か?

主な発見

  • ${\tt CombCascade}$ は、ギャップ依存のレギュレートバウンド $O\left(\sum_{i \in \text{suboptimal}} \frac{\log n}{\Delta_i}\right)$ を達成する。ここで $\Delta_i$ は最適と非最適なアイテムの間のギャップを表す。
  • ギャップフリーのレギュレートバウンドは $O(\sqrt{K \log n})$ であり、対数要因を除いて既知の下界と一致する。
  • 実験的評価により、${\tt CombCascade}$ は、モデルの仮定が満たされない状況下でも、実世界のルーティングおよび推薦タスクにおいて ${\tt CombUCB1}$ より優れた性能を示す。
  • 線形最適化が実行可能な任意の可能な集合(例:グラフ内のパス、アイテムのリストなど)に対して、計算的に効率的である。
  • 本稿は、${\tt CombUCB1}$ が非マトロイドな設定で失敗する可能性があること(和ベースのUCB最大化に依存しているため)を示し、${\tt CombCascade}$ における積ベースのアプローチの必要性を強調する。
  • 理論的解析により、主な課題は非線形報酬関数と部分的観測の取り扱いであり、これには従来のセミバンディットフレームワークとは根本的に異なる解析が必要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。