Skip to main content
QUICK REVIEW

[论文解读] Cooperative Multi-Agent Bandits with Heavy Tails

Abhimanyu Dubey, Alex Pentland|arXiv (Cornell University)|Aug 14, 2020
Advanced Bandit Algorithms Research参考文献 48被引用 5
一句话总结

本文提出MP-UCB,一种去中心化的多智能体Bandit算法,通过截尾均值的鲁棒估计与消息传递协议,处理合作网络中重尾奖励分布的问题。在$ (1+\varepsilon) $-重尾奖励下,实现了$ O(\text{poly}(\text{polylog}(T))) $的最优问题相关遗憾边界,优于以往基于共识的方法,后者在该分布下失效。

ABSTRACT

We study the heavy-tailed stochastic bandit problem in the cooperative multi-agent setting, where a group of agents interact with a common bandit problem, while communicating on a network with delays. Existing algorithms for the stochastic bandit in this setting utilize confidence intervals arising from an averaging-based communication protocol known as~ extit{running consensus}, that does not lend itself to robust estimation for heavy-tailed settings. We propose extsc{MP-UCB}, a decentralized multi-agent algorithm for the cooperative stochastic bandit that incorporates robust estimation with a message-passing protocol. We prove optimal regret bounds for extsc{MP-UCB} for several problem settings, and also demonstrate its superiority to existing methods. Furthermore, we establish the first lower bounds for the cooperative bandit problem, in addition to providing efficient algorithms for robust bandit estimation of location.

研究动机与目标

  • 解决在重尾奖励分布下,协作多智能体Bandit缺乏鲁棒算法的问题。
  • 设计一种去中心化算法,在奖励分布具有无限方差或重尾时仍能保持低遗憾。
  • 建立协作多智能体Bandit在重尾设置下的首个问题相关下界。
  • 证明现有基于共识的方法在$ 2 $-重尾下遗憾表现次优($ O(T^{2/3}) $)。
  • 实现遗憾缩放的$ |V| $-最优性,优于以往的$ O(\log|V|) $依赖关系。

提出的方法

  • MP-UCB使用消息传递协议,在具有通信延迟的网络中交换智能体间的局部奖励估计。
  • 通过鲁棒截尾均值估计替代经验均值估计,以处理重尾奖励分布。
  • 算法采用基于$ v^{1/(1+\varepsilon)} \left( \frac{2c\ln t}{N_k^{m^*}(t)} \right)^{\varepsilon/(1+\varepsilon)} $的UCB风格置信区间,该公式源自$ (1+\varepsilon) $-重尾假设下的鲁棒估计。
  • 每个智能体维护观测奖励的本地集合$ S_k^m $,并利用邻居信息通过邻居估计的最大聚合来估计最优动作。
  • 通过修剪机制移除过时消息,以保持通信效率并防止信息膨胀。
  • 算法确保仅使用最新且可靠的估计进行动作选择,降低对异常值的敏感性。

实验结果

研究问题

  • RQ1在重尾奖励分布下,协作多智能体Bandit的群体遗憾是否存在根本限制(下界)?
  • RQ2去中心化算法能否在$ (1+\varepsilon) $-重尾奖励下实现最优遗憾缩放,特别是在方差无限的情况下?
  • RQ3与鲁棒估计相比,基于共识的平均方法在重尾分布下的性能退化程度如何?
  • RQ4能否设计出在重尾奖励分布下保持低遗憾且具备鲁棒性的消息传递协议?
  • RQ5在重尾设置下,协作Bandit中是否可实现遗憾缩放的$ |V| $-最优性?

主要发现

  • 本文首次建立了在$ (1+\varepsilon) $-重尾奖励下,协作多智能体Bandit的$ \Omega(K\Delta^{-1/\varepsilon}\ln T) $问题相关下界。
  • MP-UCB实现了群体遗憾边界$ O\left( \alpha(\mathcal{G}_\gamma) v^{1/\varepsilon} \ln T \sum_{k:\Delta_k>0} \Delta_k^{-1/\varepsilon} \right) $,与推导出的下界仅在对数因子上存在差异。
  • 与基于共识的方法不同,MP-UCB通过使用鲁棒估计而非经验均值,避免了在$ 2 $-重尾下出现的$ O(T^{2/3}) $遗憾。
  • 该算法实现了遗憾缩放的$ |V| $-最优性,优于以往方法中$ O(\log|V|) $的依赖关系。
  • 遗憾边界依赖于$ v^{1/\varepsilon} $,该参数刻画了尾部的厚重程度,且当$ \varepsilon \to 0 $时表现平滑退化,与次高斯极限一致。
  • 实验结果表明,MP-UCB在重尾环境下的表现优于现有基于共识的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。