Skip to main content
QUICK REVIEW

[论文解读] Non-Stochastic Multi-Player Multi-Armed Bandits: Optimal Rate With Collision Information, Sublinear Without

Sébastien Bubeck, Yuanzhi Li|arXiv (Cornell University)|Apr 28, 2019
Advanced Bandit Algorithms Research参考文献 19被引用 5
一句话总结

本文首次为具有碰撞信息的非随机多玩家多臂赌博机问题提供了最优的 $√{T}$ regret 边界,并首次在无碰撞信息的情况下实现了 $T^{1-1/(2m)}$ 的次线性 regret 边界。该研究提出了一种基于交换的新型策略,通过结构化的动作映射避免碰撞,并在对抗性损失序列下实现次最优 regret。

ABSTRACT

We consider the non-stochastic version of the (cooperative) multi-player multi-armed bandit problem. The model assumes no communication at all between the players, and furthermore when two (or more) players select the same action this results in a maximal loss. We prove the first $\sqrt{T}$-type regret guarantee for this problem, under the feedback model where collisions are announced to the colliding players. Such a bound was not known even for the simpler stochastic version. We also prove the first sublinear guarantee for the feedback model where collision information is not available, namely $T^{1-\frac{1}{2m}}$ where $m$ is the number of players.

研究动机与目标

  • 解决在无玩家间通信的非随机、去中心化多玩家多臂赌博机中实现次线性 regret 的开放问题。
  • 在碰撞信息明确告知碰撞玩家的反馈模型下,首次提供最优 $√{T}$ regret 保证。
  • 在更具有挑战性的设置中,即碰撞信息不可用时,首次建立 $T^{1-1/(2m)}$ 的次线性 regret 边界。
  • 证明 sublinear regret 仅在对抗性对手为固定损失序列(即非自适应对手)时可能实现,而对自适应对手则无法实现,后者可强制产生 $Ω(T)$ 的 regret。
  • 将结果从两名玩家推广至 $m$ 名玩家,表明在两种反馈模型下,regret 随玩家数量 $m$ 的增长而平滑扩展。

提出的方法

  • 提出一种基于交换的策略,使用一族函数 $\Phi_{k}$,将较慢玩家的动作映射,以确保所有 $m$ 名玩家在不发生碰撞的情况下共同探索全部 $m$ 个目标动作。
  • 将 $\Phi_{k}$ 定义为在前 $k-1$ 步中尚未使用且满足 $a_j \geq m-k+1$ 的最小可用动作 $a_j$,以确保有效且无重复的分配。
  • 将时间范围划分为 $T^{(i-1)/m}$ 个块,每个玩家 $i$ 分别处理,利用引理 15 通过损失估计的集中性来限制每个块内的 regret。
  • 构建一个依赖于前序玩家动作历史和目标动作集 $\{a_1, \dots, a_m\}$ 的函数 $\Phi_{i,t}$,确保每个时间块内所有目标动作恰好被覆盖一次。
  • 利用 $\{\Phi_{j,t}(A_{j,t})\}_{j\leq m}$ 在每个时间 $t$ 构成 $\{a_1, \dots, a_m\}$ 的一个排列这一事实,实现对所有玩家的联合 regret 分析。
  • 通过计数论证证明 $\widetilde{A}_k$ 在 $\Phi_k$ 构造中的存在性,确保算法不会分配已使用过的动作,也不会违反下界约束。

实验结果

研究问题

  • RQ1当碰撞信息可用时,是否可以在非随机多玩家赌博机问题中实现最优 $\sqrt{T}$ regret?
  • RQ2当碰撞信息不可用时,是否可以在非随机多玩家赌博机问题中实现 sublinear regret?
  • RQ3在自适应对手下,非随机多玩家赌博机模型中的 regret 的根本极限是什么?
  • RQ4在无碰撞反馈模型下,regret 如何随玩家数量 $m$ 变化?
  • RQ5是否可以设计一种去中心化、无需通信的多玩家策略,仅通过局部观测和共享随机性实现次优 regret?

主要发现

  • 本文首次在碰撞信息可用的情况下,实现了非随机多玩家多臂赌博机问题的最优 $\widetilde{O}(\sqrt{T})$ regret 边界。
  • 在无碰撞反馈模型中,本文首次建立了 $O(mK^{3/2}T^{1-1/(2m)}\sqrt{\log K})$ 的次线性 regret 边界。
  • 本文证明,面对自适应对手时,sublinear regret 是不可能实现的,因为此类对手即使在有碰撞信息的情况下,也能强制产生 $\Omega(T)$ 的 regret。
  • regret 边界 $T^{1-1/(2m)}$ 随 $m$ 增大而退化,但对于任意固定的 $m$ 仍保持次线性。
  • 所提出的策略使用了一种新颖的交换函数 $\Phi_k$,确保所有 $m$ 名玩家在不发生碰撞的情况下共同探索一组固定的 $m$ 个动作,从而支持联合 regret 分析。
  • 通过计数论证证明了 $\Phi_k$ 的构造,表明存在满足值和索引约束的合法、无重复的动作分配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。