Skip to main content
QUICK REVIEW

[論文レビュー] Polynomial-time Algorithms for Combinatorial Pure Exploration with Full-bandit Feedback

Yuko Kuroki, Liyuan Xu|arXiv (Cornell University)|Jan 1, 2019
Advanced Bandit Algorithms Research参考文献 20被引用数 3
ひとこと要約

本稿では、全バンドイットフィードバック(各腕の報酬の合計のみ観測可能)の下で、確率的組み合わせ的純粋探索のための多項式時間アルゴリズムを提示する。0-1二次最大化問題のための新規近似アルゴリズムを導入し、理論的保証付きの効率的サンプル複雑度を達成することで、組み合わせ的バンディット設定におけるスケーラブルなトップ-k選択を可能にする。

ABSTRACT

We study the problem of stochastic combinatorial pure exploration (CPE), where an agent sequentially pulls a set of single arms (a.k.a. a super arm) and tries to find the best super arm. Among a variety of problem settings of the CPE, we focus on the full-bandit setting, where we cannot observe the reward of each single arm, but only the sum of the rewards. Although we can regard the CPE with full-bandit feedback as a special case of pure exploration in linear bandits, an approach based on linear bandits is not computationally feasible since the number of super arms may be exponential. In this paper, we first propose a polynomial-time bandit algorithm for the CPE under general combinatorial constraints and provide an upper bound of the sample complexity. Second, we design an approximation algorithm for the 0-1 quadratic maximization problem, which arises in many bandit algorithms with confidence ellipsoids. Based on our approximation algorithm, we propose novel bandit algorithms for the top-k selection problem, and prove that our algorithms run in polynomial time. Finally, we conduct experiments on synthetic and real-world datasets, and confirm the validity of our theoretical analysis in terms of both the computation time and the sample complexity.

研究の動機と目的

  • 指数的サイズのスーパーアーム空間を有する組み合わせ的純粋探索において、既存の線形バンディット手法の計算不能性を解消すること。
  • 一般の組み合わせ的制約を満たす組み合わせ的純粋探索のための多項式時間バンディットアルゴリズムを、全バンドイットフィードバックの下で設計すること。
  • 信頼楕円体に基づくバンディット手法の主要部分である0-1二次最大化問題のための効率的近似アルゴリズムを開発すること。
  • 全バンドイットフィードバックの下で、スケーラブルかつ理論的に効率的なトップ-k選択を実現すること。
  • 合成データおよび実世界のデータセットを用いた実験を通じて、理論的サンプル複雑度および計算時間を検証すること。

提案手法

  • 全バンドイットフィードバックを用いた一般の組み合わせ的制約を満たす組み合わせ的純粋探索のための多項式時間バンディットアルゴリズムを提案する。
  • 信頼楕円体計算に生じる0-1二次最大化問題のための新規近似アルゴリズムを導入する。
  • この近似アルゴリズムを活用して、トップ-k選択問題のための効率的バンディットアルゴリズムを設計する。
  • 信頼楕円体とサンプル複雑度の分析を用いて、最適なスーパーアームへの収束を保証する。
  • 部分的フィードバック下で探索と活用のバランスを取るためのサンプリング戦略を設計する。
  • 理論的分析を用いて、提案アルゴリズムのサンプル複雑度の上界を導出する。

実験結果

リサーチクエスチョン

  • RQ1全バンドイットフィードバックの下で、理論的サンプル複雑度の保証を持つ多項式時間アルゴリズムを設計できるか?
  • RQ2信頼楕円体に基づくバンディットアルゴリズムに生じる0-1二次最大化問題を効率的に解く方法は何か?
  • RQ3提案された近似アルゴリズムをバンディットアルゴリズムに統合することで、トップ-k選択における効率性と正しさを両立できるか?
  • RQ4提案手法は、実際の計算においても多項式時間で動作し、低サンプル複雑度を達成できるか?
  • RQ5理論的サンプル複雑度の上限は、合成データおよび実世界のデータセットにおける実験的性能とどのように一致するか?

主な発見

  • 提案アルゴリズムは、全バンドイットフィードバックの下で組み合わせ的純粋探索のための理論的上界をサンプル複雑度に達成する。
  • 0-1二次最大化問題のための近似アルゴリズムにより、正確な解が計算不能な状況下でも多項式時間での計算が可能になる。
  • 得られたトップ-k選択のためのバンディットアルゴリズムは多項式時間で実行され、理論的保証を維持する。
  • 実験により、理論的サンプル複雑度の上限が合成データおよび実世界のデータセットにおける実効的性能と一致することが確認された。
  • 特に高次元の組み合わせ的空間において、単純な線形バンディット手法と比較して計算時間が顕著に短縮された。
  • 実際の応用において、アルゴリズムはスケーラビリティと効率性を示し、サンプル複雑度および実行時間の理論的分析を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。