Skip to main content
QUICK REVIEW

[論文レビュー] Cooperative and Stochastic Multi-Player Multi-Armed Bandit: Optimal Regret With Neither Communication Nor Collisions

Sébastien Bubeck, Thomas Budzinski|arXiv (Cornell University)|Nov 7, 2020
Advanced Bandit Algorithms Research被引用数 6
ひとこと要約

本稿では、共有ランダムネスを用いた協調的マルチプレイヤー・マルチアームバンディットに対して、衝突が一切ない状態で最適なレグレット $O(mK^{11/2}\tilde{O}(√{T\log T}))$ を達成する新しい確率的戦略を提示する。この手法は階層的意思決定ツリーとパrameter空間の安定的パーティショニングを用い、通信がなくてもプレイヤーが同じアームを選ばないことを保証する。これは組み合わせ的構造と不確実性下でのロバスト推定を活用することで実現される。

ABSTRACT

We consider the cooperative multi-player version of the stochastic multi-armed bandit problem. We study the regime where the players cannot communicate but have access to shared randomness. In prior work by the first two authors, a strategy for this regime was constructed for two players and three arms, with regret $\ ilde{O}(\\sqrt{T})$, and with no collisions at all between the players (with very high probability). In this paper we show that these properties (near-optimal regret and no collisions at all) are achievable for any number of players and arms. At a high level, the previous strategy heavily relied on a $2$-dimensional geometric intuition that was difficult to generalize in higher dimensions, while here we take a more combinatorial route to build the new strategy.

研究の動機と目的

  • 通信や衝突ペナルティなしに、近似的に最適なレグレットを達成する協調的マルチプレイヤー・マルチアームバンディット戦略の設計。
  • 従来の2プレイヤー・3アームに限局した研究を、任意の数のプレイヤーやアームに拡張すること。
  • 通信や衝突ペナルティの必要性を排除し、高確率でプレイヤーが同じアームを選ばないことを保証すること。
  • 低次元幾何的構成を超えるスケーラブルで組み合わせ的な戦略の開発。

提案手法

  • 未決定のアームに関する意思決定ツリーに基づく、時刻に依存する色分けされた $[0,1]^K$ パラメータ空間のパーティショニング。
  • 各パーティショニング要素は、推奨される $m$-タプルのアームに対応し、ツリー上の隣接ノード間に衝突が生じないよう色が割り当てられる。
  • 安定性の性質により、近い実測推定値が隣接するパーティショニング要素を導き、衝突のない動作を維持する。
  • 信頼区間と $\varepsilon_t$-依存インターフェースによるしきい値処理を用いて、推定値を動的に精緻化する。
  • 主な技術的イノベーションとして、パーティショニングの結果に影響を与えないまま高誤差座標を補正する修正確率推定値 $\widetilde{q}_t^X$ の使用。
  • レグレット解析では、補正済み推定値を用いた「抜け道戦略」を用いて乖離を制限し、最終的なレグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1通信や衝突ペナルティなしに、協調的マルチプレイヤー・マルチアームバンディット問題で最適なレグレットを達成可能か?
  • RQ2従来の2プレイヤー・3アーム戦略を、任意の数のプレイヤーやアームに一般化可能か?
  • RQ3幾何的構成に代わる、組み合わせ的でツリーに基づくパーティショニング方式によって、衝突のない行動選択を保証可能か?
  • RQ4共有ランダムネスを用いて通信なしでプレイヤーを調整しつつ、レグレットの非最適性を維持可能か?

主な発見

  • 提案戦略は、期待レグレットが $O(mK^{11/2}\tilde{O}(√{T\log T}))$ で抑えられ、対数要因を除いて単一プレイヤーの最適レグレットと一致する。
  • 確率 $1 - 1/T$ 以上で、全ホライズン $T$ の間、プレイヤー同士が一切衝突しない。
  • 戦略は階層的意思決定ツリーとパrameter空間の安定的パーティショニングに依存しており、近い推定値が非衝突行動を導くことを保証する。
  • 修正確率推定値 $\widetilde{q}_t^X$ の使用により、パーティショニングの結果に影響を与えずに推定誤差を是正できる。
  • 実戦略が補正済み推定値を用いた「抜け道戦略」と同一に動作することを示すことで、明確な解析が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。