Skip to main content
QUICK REVIEW

[論文レビュー] Information Directed Sampling for Stochastic Bandits with Graph Feedback

Fang Liu, Swapna Buccapatnam|arXiv (Cornell University)|Nov 8, 2017
Advanced Bandit Algorithms Research被引用数 20
ひとこと要約

本稿は、時間変動するグラフフィードバックを伴う確率的マルチアームバンディットに対して、情報指向サンプリング(IDS)に基づく方策を提案する。観測された行動から隣接する行動の報酬が得られる。決定的ケースではグラフのクリーク被覆数に比例するベイジアンレグレットバウンドを確立し、確率的エラーズ・レニー(Erdős-Rényi)グラフケースでは、行動数と1イテレーションあたりの期待観測数の比に比例する。これは、確率的グラフフィードバックを伴うマルチアームバンディットに対する理論的保証として初のものである。数値評価では、提案されたIDS方策はトゥーリングサンプリング(TS)、UCB、ε-greedyの適応法を上回る性能を示した。

ABSTRACT

We consider stochastic multi-armed bandit problems with graph feedback, where the decision maker is allowed to observe the neighboring actions of the chosen action. We allow the graph structure to vary with time and consider both deterministic and Erdős-Rényi random graph models. For such a graph feedback model, we first present a novel analysis of Thompson sampling that leads to tighter performance bound than existing work. Next, we propose new Information Directed Sampling based policies that are graph-aware in their decision making. Under the deterministic graph case, we establish a Bayesian regret bound for the proposed policies that scales with the clique cover number of the graph instead of the number of actions. Under the random graph case, we provide a Bayesian regret bound for the proposed policies that scales with the ratio of the number of actions over the expected number of observations per iteration. To the best of our knowledge, this is the first analytical result for stochastic bandits with random graph feedback. Finally, using numerical evaluations, we demonstrate that our proposed IDS policies outperform existing approaches, including adaptions of upper confidence bound, $ε$-greedy and Exp3 algorithms.

研究の動機と目的

  • 時間変動するグラフフィードバック(隣接行動からのサイド観測が可能)を伴う確率的バンディットのための、レグレットを最小化する方策を開発すること。
  • 意思決定にグラフ構造を統合することで、従来のトゥーリングサンプリング(TS)およびUCBベースの手法を改善すること。
  • 確率的グラフフィードバック(エラーズ・レニー(Erdős-Rényi)モデル)下での確率的バンディットに対する、初めての理論的ベイジアンレグレットバウンドを確立すること。
  • グラフ構造を活用することで、IDSベースの方策がトゥーリングサンプリングよりも優れたレグレットスケーリングを達成できるかどうかを調査すること。
  • 時間不変および時間変動するグラフフィードバックの両設定において、提案された方策が既存のバンディットアルゴリズム(UCB、ε-greedy、Exp3)と比較してどのように性能を発揮するかを評価すること。

提案手法

  • IDSに基づく3つの方策(IDS-N、IDSN-LP、IDS-LP)を提案し、期待二乗レグレットを情報利得の比で最小化する行動選択を行う。
  • 従来の研究よりタイトなレグレットバウンドを導く、トゥーリングサンプリング(TS-N)の新たな解析を導入し、その結果はグラフのクリーク被覆数に依存する。
  • 情報理論的原則を用いて、探索と活用のバランスを図り、グラフ構造に起因する観測からの不確実性と情報利得を明示的にモデル化する。
  • 時間変動する構造を持つ決定的グラフと、サイド観測が確率的に消去されるエラーズ・レニー(Erdős-Rényi)モデルで生成される確率的グラフの両方を分析する。
  • ベイジアンレグレット解析を用いて、クリーク被覆数や支配数といったグラフ構造的特性に比例する、問題に依存しないバウンドを導出する。
  • IDS-LPとIDSN-LPにおいて、線形計画法(LP)に基づく戦略とグリーディ戦略を適応させ、インスタントレーレグレットを最小化しながら探索を強化する。

実験結果

リサーチクエスチョン

  • RQ1確率的バンディットにグラフフィードバックを適用した場合、IDSベースの方策はトゥーリングサンプリング(TS)よりも優れたレグレットスケーリングを達成できるか?
  • RQ2時間変動する決定的グラフフィードバック下での確率的バンディットにおける理論的ベイジアンレグレットバウンドは何か?
  • RQ3特にエラーズ・レニー(Erdős-Rényi)モデル下で、確率的グラフフィードバック下におけるIDSベースの方策の性能はどのようにスケーリングされるか?
  • RQ4IDSベースの方策において、クリーク被覆数を超えるグラフパラメータ(例:独立数)を活用することで、レグレットバウンドをさらに改善できるか?
  • RQ5時間不変および時間変動するグラフフィードバック設定の両方において、IDSベースの方策はUCB、ε-greedy、Exp3の適応法と比較して、どのように性能を発揮するか?

主な発見

  • 提案されたIDS-N、IDSN-LP、IDS-LP方策は、決定的ケースにおいて、グラフのクリーク被覆数に比例するベイジアンレグレットバウンドを達成し、理論的性能はトゥーリングサンプリング(TS)と同等であるが、実験的に優れた結果を示した。
  • 本稿では、確率的グラフフィードバックを伴う確率的バンディットに対して、初めて問題に依存しないベイジアンレグレットバウンドを確立した。そのバウンドは、行動数と1イテレーションあたりの期待観測数の比に比例する。
  • 数値評価では、IDSベースの方策が、TS-N、UCB-N、εt-greedy-LP、Exp3-SET/Exp3-Resの両方の設定で、時間不変および時間変動するグラフフィードバックの両方において優れた性能を示した。
  • IDS-LPは、行動数に比例するレグレットバウンドを持つものの、インスタントレーレグレットのグリーディ最小化と保証された探索の両方のおかげで、良好な性能を発揮した。
  • IDSベースの方策が既存手法を上回る理由は、情報指向意思決定においてグラフ構造を明示的に活用していることに起因する。
  • 結果から、独立数などのグラフパラメータを用いたIDSベース方策のレグレットバウンドのさらなるタイトニングは、未解決の問題であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。