Skip to main content
QUICK REVIEW

[论文解读] Coordination without communication: optimal regret in two players multi-armed bandits

Sébastien Bubeck, Thomas Budzinski|arXiv (Cornell University)|Feb 14, 2020
Experimental Behavioral Economics Studies被引用 14
一句话总结

本文提出了一种在无通信的随机多臂赌博机设置下,两名玩家的新型协调策略,实现了 $O(\sqrt{T\log T})$ 的遗憾,同时以高概率确保无碰撞。该方法利用共享随机性与自适应动作选择来避免干扰,与以往依赖碰撞进行隐式通信的方法形成显著区别。

ABSTRACT

We consider two agents playing simultaneously the same stochastic three-armed bandit problem. The two agents are cooperating but they cannot communicate. We propose a strategy with no collisions at all between the players (with very high probability), and with near-optimal regret $O(\\sqrt{T \\log(T)})$. We also argue that the extra logarithmic term $\\sqrt{\\log(T)}$ should be necessary by proving a lower bound for a full information variant of the problem.

研究动机与目标

  • 设计一种无需通信的双玩家合作多臂赌博机策略,以最小化遗憾。
  • 在保持近似最优遗憾的同时,完全消除玩家之间的碰撞(以高概率)。
  • 摆脱以往工作依赖碰撞进行隐式通信的依赖,该依赖在认知无线电等实际应用中限制了实用性。
  • 在无碰撞约束下,建立 $O(\sqrt{T\log T})$ 的紧致遗憾界。
  • 通过在完全信息变体中证明下界,证明遗憾中的 $\sqrt{\log T}$ 因子是必要的。

提出的方法

  • 该策略利用共享随机性来同步动作选择,确保爱丽丝和鲍勃以高概率不会同时选择同一支臂。
  • 爱丽丝在对数轮数后固定其最优动作,基于统计置信区间。
  • 鲍勃使用动态动作集,根据观测到的损失模式和置信区间排除某些臂。
  • 基于阶段的结构确保:若鲍勃重启策略,爱丽丝必须已处于固定状态,从而防止碰撞。
  • 该算法利用集中不等式(如切尔诺夫不等式)来检测动作是否次优,或碰撞是否不太可能发生。
  • 关键组件是使用阈值 $\sqrt{\log T / T}$ 来判断何时根据性能置信度排除或移除臂。

实验结果

研究问题

  • RQ1两名玩家能否在无任何通信或碰撞的情况下,在多臂赌博机问题中实现近似最优遗憾?
  • RQ2无碰撞策略的遗憾界中的 $\sqrt{\log T}$ 因子是否必要?
  • RQ3能否设计一种策略,避免依赖碰撞进行隐式通信,同时仍实现 $O(\sqrt{T\log T})$ 遗憾?
  • RQ4当碰撞以高概率被禁止时,可实现的最小遗憾是多少?
  • RQ5确定性策略能否在无共享随机性的情况下实现 $O(\sqrt{T\log T})$ 遗憾?

主要发现

  • 所提出的带共享随机性的随机策略以高概率实现 $\mathbb{E}[R_T] \leq 2^{20} \sqrt{T\log T}$ 的遗憾。
  • 以至少 $1 - 1/T$ 的概率,两名玩家在整个时间范围 $T$ 内永远不会发生碰撞。
  • 该策略消除了对碰撞信号的依赖,而后者是大多数先前方法的基础。
  • 构建了一个确定性变体,同样实现了 $O(\sqrt{T\log T})$ 遗憾,尽管常数因子更高。
  • 在完全信息变体中建立了下界,表明 $\sqrt{\log T}$ 因子对无碰撞策略是必要的。
  • 该方法确保:若鲍勃重启其策略,爱丽丝必须已处于固定状态,从而防止任何碰撞发生。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。