Skip to main content
QUICK REVIEW

[論文レビュー] Non-Stochastic Multi-Player Multi-Armed Bandits: Optimal Rate With Collision Information, Sublinear Without

Sébastien Bubeck, Yuanzhi Li|arXiv (Cornell University)|Apr 28, 2019
Advanced Bandit Algorithms Research参考文献 19被引用数 5
ひとこと要約

本稿では、衝突情報が与えられる非確率的マルチプレーヤー・マルチアームバンディットにおける最初の最適な $√{T}$ レグレットバウンドを提示し、それ以外の状況では最初の $T^{1-1/(2m)}$ の非線形レグレットバウンドを達成している。衝突を回避し、敵対的損失系列において非最適なレグレットを達成するために、構造的アクションマッピングを用いた新しいスワップベース戦略を導入している。

ABSTRACT

We consider the non-stochastic version of the (cooperative) multi-player multi-armed bandit problem. The model assumes no communication at all between the players, and furthermore when two (or more) players select the same action this results in a maximal loss. We prove the first $\sqrt{T}$-type regret guarantee for this problem, under the feedback model where collisions are announced to the colliding players. Such a bound was not known even for the simpler stochastic version. We also prove the first sublinear guarantee for the feedback model where collision information is not available, namely $T^{1-\frac{1}{2m}}$ where $m$ is the number of players.

研究の動機と目的

  • プレーヤー間の通信なしで、非確率的かつ分散型のマルチプレーヤー・マルチアームバンディットにおける非線形レグレットを達成するという未解決問題に取り組む。
  • 衝突が衝突するプレーヤーに明示的に通知されるフィードバックモデルにおいて、最初の最適な $√{T}$ レグレット保証を提供する。
  • 衝突情報が利用できないより困難な設定において、最初の非線形レグレットバウンド $T^{1-1/(2m)}$ を確立する。
  • 非適応的でない敵対的アドバーザリー(固定損失系列)に対してのみ非線形レグレットが可能であり、適応的アドバーザリーでは $Ω(T)$ のレグレットを強制できることが示される。
  • 2人のプレーヤーから $m$ 人のプレーヤーへの結果の一般化を行い、両方のフィードバックモデルにおいてプレーヤー数 $m$ に伴いレグレットが滑らかに増加することを示す。

提案手法

  • 遅いプレーヤーのアクションをマッピングする関数族 $\Phi_{k}$ を用いたスワップベース戦略を提案し、$m$ 人のプレーヤーが衝突を回避しながら、すべての $m$ 個のターゲットアクションを共同で探索できるようにする。
  • $\Phi_{k}$ を、最初の $k-1$ ステップで使用されていない最小のアクション $a_j$ として定義し、$a_j \geq m-k+1$ を満たすことで、有効で重複のない割り当てを保証する。
  • 各プレーヤー $i$ に対して、時間区間を $T^{(i-1)/m}$ のブロックに分割し、濃度推定の集中性を示すための補題15を用いて各ブロック内でのレグレットをバウンドする。
  • $\Phi_{i,t}$ を、以前のプレーヤーの行動履歴とターゲットアクション集合 $\{a_1, \dots, a_m\}$ に依存する関数として定義し、各時間ブロック内ですべてのターゲットアクションが正確に一度ずつカバーされるようにする。
  • 各時刻 $t$ において $\{\Phi_{j,t}(A_{j,t})\}_{j\leq m}$ が $\{a_1, \dots, a_m\}$ の置換を形成することを活用し、すべてのプレーヤーにわたる共同レグレット解析を可能にする。
  • 行動の再利用や下限制約の違反を避けるために、$\widetilde{A}_k$ の構成における有効な $\Phi_k$ の存在を示すために、数え上げ的議論を用いる。

実験結果

リサーチクエスチョン

  • RQ1衝突情報が利用可能な非確率的マルチプレーヤー・バンディット問題において、最適な $\sqrt{T}$ レグレットを達成することは可能か?
  • RQ2衝突情報が利用できない非確率的マルチプレーヤー・バンディット問題において、非線形レグレットを達成することは可能か?
  • RQ3適応的アドバーザリー下での非確率的マルチプレーヤー・バンディットモデルにおけるレグレットの根本的限界は何か?
  • RQ4衝突なしフィードバックモデルにおいて、プレーヤー数 $m$ に伴いレグレットはどのようにスケーリングするか?
  • RQ5分散型で通信を行わないマルチプレーヤー戦略は、ローカル観測と共有ランダムネスのみを用いて、非最適なレグレットを達成できるか?

主な発見

  • 本稿では、衝突情報が利用可能な非確率的マルチプレーヤー・マルチアームバンディットにおいて、最初の最適な $\widetilde{O}(\sqrt{T})$ レグレットバウンドを達成している。
  • 衝突なしフィードバックモデルにおいて、本稿は最初の非線形レグレットバウンド $O(mK^{3/2}T^{1-1/(2m)}\sqrt{\log K})$ を確立している。
  • 本稿では、適応的アドバーザリーに対して非線形レグレットが不可能であることを証明しており、そのようなアドバーザリーですら、衝突情報が存在しても $\Omega(T)$ のレグレットを強制できる。
  • レグレットバウンド $T^{1-1/(2m)}$ は $m$ の増加に伴い劣化するが、任意の固定された $m$ に対して非線形のままである。
  • 提案された戦略は、$m$ 人のプレーヤーが衝突を回避しながら、固定された $m$ 個のアクションを共同で探索できるようにする、新しいスワップ関数 $\Phi_k$ を用いている。これにより、共同レグレット解析が可能になる。
  • $\Phi_k$ の構成は、値制約とインデックス制約を満たす重複のない行動割り当ての存在を示す数え上げ的議論により証明されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。