Skip to main content
QUICK REVIEW

[論文レビュー] Batch-Size Independent Regret Bounds for Combinatorial Semi-Bandits with Probabilistically Triggered Arms or Independent Arms

Xutong Liu, Jinhang Zuo|arXiv (Cornell University)|Aug 31, 2022
Advanced Bandit Algorithms Research被引用数 6
ひとこと要約

本稿では、確率的ターゲットアームを伴う組み合わせ的セミバンディットにおけるバッチサイズに依存しないレギュレートバウンドを提示する。新規の分散に配慮したアルゴリズム(BCUCB-T)と、新たな滑らかさ条件(TPVM)を導入することで、レギュレートのバッチサイズK依存性をO(K)からO(log K)またはO(log²K)に低減した。独立アームの場合、サブ指数的信頼区間を備えたSESCBを提案し、完全にバッチサイズに依存しないレギュレートを達成した。これは、先行研究のレギュレートバウンドを著しく改善し、実験的性能も約20%向上した。

ABSTRACT

In this paper, we study the combinatorial semi-bandits (CMAB) and focus on reducing the dependency of the batch-size $K$ in the regret bound, where $K$ is the total number of arms that can be pulled or triggered in each round. First, for the setting of CMAB with probabilistically triggered arms (CMAB-T), we discover a novel (directional) triggering probability and variance modulated (TPVM) condition that can replace the previously-used smoothness condition for various applications, such as cascading bandits, online network exploration and online influence maximization. Under this new condition, we propose a BCUCB-T algorithm with variance-aware confidence intervals and conduct regret analysis which reduces the $O(K)$ factor to $O(\log K)$ or $O(\log^2 K)$ in the regret bound, significantly improving the regret bounds for the above applications. Second, for the setting of non-triggering CMAB with independent arms, we propose a SESCB algorithm which leverages on the non-triggering version of the TPVM condition and completely removes the dependency on $K$ in the leading regret. As a valuable by-product, the regret analysis used in this paper can improve several existing results by a factor of $O(\log K)$. Finally, experimental evaluations show our superior performance compared with benchmark algorithms in different applications.

研究の動機と目的

  • 組み合わせ的セミバンディットにおけるバッチサイズKに依存するレギュレートバウンドの低減または排除。
  • 平均アーム値が0または1に近い境界領域における報酬ダイナミクスをよりよく捉える新しい滑らかさ条件(TPVM)の開発。
  • 実験的分散に応じて適応する分散に配慮した信頼区間の設計により、高感度領域におけるレギュレート寄与の低減。
  • 独立アームを伴う非ターゲティングCMABにおいて、サブ指数的集中を用いて完全にバッチサイズに依存しないレギュレートを達成すること。
  • 洗練された解析により、既存のレギュレートバウンドをO(log K)の要因で改善すること。

提案手法

  • 従来のTPM条件の強化として、境界付近の局所的報酬感度を捉える、ターゲティング確率および分散調節(TPVM)条件を導入する。
  • 実験的分散に比例してスケーリングされる分散に配慮した信頼区間を備えたUCBスタイルのアルゴリズムBCUCB-Tを提案する。
  • TPVM条件を活用して境界領域におけるレギュレート寄与をバウンドし、K依存性をO(K)からO(log K)またはO(log²K)に低減する。
  • 独立アームの場合、TPVMの非ターゲティング版であるVM条件を導入し、よりタイトなサブ指数的信頼区間を備えたSESCBを設計する。
  • サブ指数的集中不等式を用いて、最小観測回数のアームのみに依存する総レギュレートをバウンドし、K依存性を排除する。
  • 洗練されたレギュレート解析により、[11, 23]などの先行研究の既存バウンドをO(log K)の要因で改善する。

実験結果

リサーチクエスチョン

  • RQ1確率的ターゲットアームを伴う組み合わせ的セミバンディットにおいて、バッチサイズKに依存するレギュレートバウンドを低減することは可能か?
  • RQ2分散を考慮した新しい滑らかさ条件は、境界領域におけるレギュレートバウンドの改善に寄与するか?
  • RQ3分散に配慮した信頼区間は、CMAB-TにおけるO(K)要因のレギュレートを排除できるか?
  • RQ4独立アームを伴う非ターゲティングCMABにおいて、完全にバッチサイズに依存しないレギュレートを達成することは可能か?
  • RQ5提案された解析により、既存のレギュレートバウンドをO(log K)の要因で改善できるか?

主な発見

  • BCUCB-TはTPVM条件下で、バッチサイズKに依存するレギュレートをO(K)からO(log K)またはO(log²K)に低減した。
  • カスケーディングバンドイットおよびオンラインインフルエンス最大化において、新しいレギュレートバウンドは先行研究の結果よりも著しくタイトである。
  • SESCBはVM条件とサブ指数的信頼区間を活用することで、独立アームを伴う非ターゲティングCMABにおいて完全にバッチサイズに依存しないレギュレートを達成した。
  • 実験結果では、BCUCB-Tは20万ラウンドにわたるカスケーディングバンドイットにおいて、CUCBおよびBCUCB-Tと比較して約20%低いレギュレートを達成した。
  • SESCBは確率的最大カバレージ問題において、BCUCB-TおよびESCBと比較してレギュレートを約15%低減した。
  • 洗練されたレギュレート解析により、[11, 23]などの先行研究が対象とする既存バウンドがO(log K)の要因で改善された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。