Skip to main content
QUICK REVIEW

[論文レビュー] Regret Bounds for Stochastic Combinatorial Multi-Armed Bandits with Linear Space Complexity

Mridul Agarwal, Vaneet Aggarwal|arXiv (Cornell University)|Nov 29, 2018
Advanced Bandit Algorithms Research参考文献 18被引用数 9
ひとこと要約

本稿では、非線形報酬関数を伴う確率的組合せ的マルチアームバンディット問題に対して、計算効率が高く、線形空間のアルゴリズムであるCMAB-SMを提案する。分割統治戦略を用いることで、$\tilde{O}(K^{1/2}N^{1/3}T^{2/3})$ のレグレットバウンドを達成し、$T$、$N$、$K$ に対して非線形である。標準的手法の$\binom{N}{K}$ 組み合わせと比較して顕著に優れている。

ABSTRACT

Many real-world problems face the dilemma of choosing best $K$ out of $N$ options at a given time instant. This setup can be modelled as combinatorial bandit which chooses $K$ out of $N$ arms at each time, with an aim to achieve an efficient tradeoff between exploration and exploitation. This is the first work for combinatorial bandit where the reward received can be a non-linear function of the chosen $K$ arms. The direct use of multi-armed bandit requires choosing among $N$-choose-$K$ options making the state space large. In this paper, we present a novel algorithm which is computationally efficient and the storage is linear in $N$. The proposed algorithm is a divide-and-conquer based strategy, that we call CMAB-SM. Further, the proposed algorithm achieves a regret bound of $ ilde O(K^\frac{1}{2}N^\frac{1}{3}T^\frac{2}{3})$ for a time horizon $T$, which is sub-linear in all parameters $T$, $N$, and $K$. The evaluation results on different reward functions and arm distribution functions show significantly improved performance as compared to standard multi-armed bandit approach with $\binom{N}{K}$ choices.

研究の動機と目的

  • K個のアームからN個のアームを選択する際、標準的手法が$\binom{N}{K}$ 組み合わせを生じるため計算的に非効率になる問題に対処すること。
  • 組合せ的バンディット設定において非線形報酬関数を扱いながら、低メモリ複雑度を維持するアルゴリズムを設計すること。
  • 非線形報酬を伴う確率的組合せ的バンディット問題において、$T$、$N$、$K$ に対して非線形のレグレットバウンドを達成すること。
  • N や K が増加する際、性能が著しく低下する標準的手法と比較して、性能を向上させること。

提案手法

  • アルゴリズムは、Kアーム選択問題をより小さな管理可能な部分問題に分解する分割統治戦略を採用する。
  • N に対して線形の空間複雑度を維持することで、大規模なNへのスケーラビリティを実現する。
  • 組合せ的アーム集合における非線形報酬関数に特化した、新しい探索と活用のトレードオフメカニズムを用いる。
  • 部分問題における探索のバランスと期待報酬の効率的推定を通じて、レグレットバウンドを達成する。
  • すべての$\binom{N}{K}$ 組み合わせを列挙するのを避け、アーム集合を再帰的に分割し、有望なサブセットに焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1組合せ的バンディットアルゴリズムは、$T$、$N$、$K$ に対して非線形のレグレットバウンドを達成しつつ、線形空間複雑度を維持できるか?
  • RQ2非線形報酬設定において、$\binom{N}{K}$ 組み合わせを考慮する標準的手法と比較して、分割統治アプローチの性能はどのように異なるか?
  • RQ3非線形報酬を伴う確率的組合せ的バンディット問題において、線形空間のアルゴリズムが達成可能な理論的レグレットバウンドは何か?
  • RQ4提案手法は、全探索を避けても、大規模な$N$ および中程度の$K$ に対して効率的にスケーリングできるか?

主な発見

  • 提案されたCMAB-SMアルゴリズムは、$\tilde{O}(K^{1/2}N^{1/3}T^{2/3})$ のレグレットバウンドを達成し、$T$、$N$、$K$ に対して非線形である。
  • アルゴリズムは$N$ に対して線形空間複雑度を維持しており、大規模な問題へのスケーラビリティを実現している。
  • 実験的評価により、すべての$\binom{N}{K}$ 組み合わせを考慮する標準的手法と比較して、顕著に優れた性能が示された。
  • 分割統治戦略は、計算負荷を効果的に低減しつつ、レグレット保証を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。