Skip to main content
QUICK REVIEW

[论文解读] Multi-Agent Multi-Armed Bandits with Limited Communication

Mridul Agarwal, Vaneet Aggarwal|arXiv (Cornell University)|Feb 10, 2021
Advanced Bandit Algorithms Research参考文献 24被引用 16
一句话总结

本文提出 LCC-UCB 和 LCC-UCB-GRAPH 两种多智能体多臂赌博机算法,在通信受限条件下最小化累积遗憾。智能体在倍增周期内协作,仅共享最优臂的索引(O(log K) 位),分别实现 Õ(√((K/N + N)T)) 和 Õ(D√((K/N + K_G)DT)) 的遗憾,优于集中式与仅与邻居通信的策略,且通信开销极低。

ABSTRACT

We consider the problem where $N$ agents collaboratively interact with an instance of a stochastic $K$ arm bandit problem for $K \gg N$. The agents aim to simultaneously minimize the cumulative regret over all the agents for a total of $T$ time steps, the number of communication rounds, and the number of bits in each communication round. We present Limited Communication Collaboration - Upper Confidence Bound (LCC-UCB), a doubling-epoch based algorithm where each agent communicates only after the end of the epoch and shares the index of the best arm it knows. With our algorithm, LCC-UCB, each agent enjoys a regret of $ ilde{O}\left(\sqrt{({K/N}+ N)T} ight)$, communicates for $O(\log T)$ steps and broadcasts $O(\log K)$ bits in each communication step. We extend the work to sparse graphs with maximum degree $K_G$, and diameter $D$ and propose LCC-UCB-GRAPH which enjoys a regret bound of $ ilde{O}\left(D\sqrt{(K/N+ K_G)DT} ight)$. Finally, we empirically show that the LCC-UCB and the LCC-UCB-GRAPH algorithm perform well and outperform strategies that communicate through a central node

研究动机与目标

  • 在通信受限的多智能体多臂赌博机问题中最小化累积遗憾。
  • 通过将消息大小限制在 O(log K) 位、通信轮数限制在 O(log T) 轮,降低通信成本。
  • 设计可扩展的算法,在稀疏、去中心化的网络中仍保持接近最优的遗憾性能。
  • 在全连接与稀疏图拓扑结构下,优于现有策略(如中心节点通信与基于邻居的消息传递)

提出的方法

  • LCC-UCB 使用倍增周期,智能体在每轮周期内对部分臂运行 UCB,并在周期结束时仅共享最优臂的索引。
  • 每个智能体维护一个本地臂集合,并在每个周期后根据从其他智能体接收的臂索引更新该集合。
  • 该算法确保最优臂与推荐臂之间的差距随周期递减,从而提升遗憾性能。
  • LCC-UCB-GRAPH 通过将周期划分为子周期,将该机制扩展至稀疏图,使智能体在每个子阶段基于邻居信息进行更新。
  • 在 LCC-UCB-GRAPH 中,智能体在每个子阶段使用邻居提供的更新后臂集重新启动 UCB,从而在直径为 D、最大度为 K_G 的图中降低遗憾。
  • 两种算法均使用上界置信度(UCB)探索机制,并利用仅需共享臂索引而非完整奖励估计的事实。

实验结果

研究问题

  • RQ1在多智能体赌博机中,通信受限时能否实现接近最优超智能体边界 Õ(√(KT/N)) 的遗憾?
  • RQ2在去中心化多智能体赌博机设置中,如何在保持低遗憾的同时最小化通信成本(以比特数与轮数衡量)?
  • RQ3网络拓扑结构(特别是直径 D 与最大度 K_G)对稀疏通信图中遗憾性能有何影响?
  • RQ4在遗憾性能与可扩展性方面,LCC-UCB-GRAPH 中的子周期通信是否优于全周期或逐轮通信策略?

主要发现

  • LCC-UCB 实现了 Õ(√((K/N + N)T)) 的遗憾边界,接近协作赌博机的理论下界 Õ(√(KT/N))。
  • LCC-UCB-GRAPH 在稀疏图中实现 Õ(D√((K/N + K_G)DT)) 的遗憾,通信复杂度每节点被限制在 O(K_G D log T) 条消息内。
  • 实验结果表明,LCC-UCB-GRAPH 显著优于无通信与逐轮邻居通信策略,尤其在 p = 10/N 的稀疏图中表现更优。
  • 当 K = 250 且 N = 100 或 150 时,LCC-UCB-GRAPH 的性能与全通信策略相当,原因在于 K_G 较低且每智能体拥有的臂数 ≤5。
  • LCC-UCB-GRAPH 累积的遗憾显著低于基于中继的 LCC-UCB,证明子周期更新相比全周期通信更具优势。
  • 即使 DEMAB 算法的通信轮数更低(仅 O(N log(NK)) 轮),LCC-UCB-GRAPH 仍优于 DEMAB。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。