Skip to main content
QUICK REVIEW

[论文解读] Fair Algorithms for Multi-Agent Multi-Armed Bandits

Safwan Hossain, Evi Micha|arXiv (Cornell University)|Jul 13, 2020
Advanced Bandit Algorithms Research参考文献 33被引用 16
一句话总结

本文提出了一种多智能体多臂赌博机框架,其中每个智能体为各臂分配不同的随机奖励,并设计了公平学习算法,以最大化纳什社会福利(NSW)作为公平性准则。该研究提出了Explore-First、Epsilon-Greedy和UCB的多智能体变体,证明其在损失NSW方面实现次线性遗憾,确保在具有不同偏好的智能体之间实现公平的长期臂选择分布。

ABSTRACT

We propose a multi-agent variant of the classical multi-armed bandit problem, in which there are $N$ agents and $K$ arms, and pulling an arm generates a (possibly different) stochastic reward for each agent. Unlike the classical multi-armed bandit problem, the goal is not to learn the "best arm"; indeed, each agent may perceive a different arm to be the best for her personally. Instead, we seek to learn a fair distribution over the arms. Drawing on a long line of research in economics and computer science, we use the Nash social welfare as our notion of fairness. We design multi-agent variants of three classic multi-armed bandit algorithms and show that they achieve sublinear regret, which is now measured in terms of the lost Nash social welfare.

研究动机与目标

  • 解决多智能体决策中因智能体对臂的偏好冲突而产生的公平性问题。
  • 在影响多个利益相关者的场景(如企业决策或会议评审系统)中建模集体策略选择。
  • 以纳什社会福利作为平衡的公平性准则,替代功利主义或平等主义的公平性标准。
  • 设计学习算法,即使在奖励分布未知的情况下,也能收敛到最大化NSW的臂分布。
  • 建立以损失的纳什社会福利衡量的遗憾边界,确保遗憾随时间跨度T的增长为次线性。

提出的方法

  • 将经典的多臂赌博机算法——Explore-First、Epsilon-Greedy和UCB——适配到具有智能体特定奖励的多智能体场景。
  • 将遗憾定义为相对于最优臂分布的纳什社会福利累积损失。
  • 使用智能体特定奖励的经验均值估计来指导臂的选择,通过探索平衡确保收敛。
  • 对于UCB,引入一个结合估计NSW和探索奖励的置信上界,以平衡利用与探索。
  • 在UCB变体中对NSW进行对数变换以实现高效优化,尽管遗憾边界是基于原始NSW函数推导的。
  • 证明所提出的算法在T上实现次线性遗憾,即使在智能体间奖励异质性下,遗憾的增长速度也慢于T。

实验结果

研究问题

  • RQ1我们能否为多智能体多臂赌博机设计学习算法,在智能体对臂的偏好存在冲突时实现公平性?
  • RQ2最大化纳什社会福利是否能产生尊重少数派偏好的公平臂选择分布,而不会陷入多数派暴政?
  • RQ3经典赌博机算法能否被适配,以在以损失NSW衡量遗憾时仍保持次线性遗憾?
  • RQ4所提算法的遗憾是否以一种随智能体数和臂数良好扩展的方式受约束?
  • RQ5在此多智能体公平性设置中,遗憾的理论极限是什么?能否推导出更紧的下界?

主要发现

  • 所提出的Explore-First、Epsilon-Greedy和UCB的多智能体变体均在时间跨度T上实现次线性遗憾,以纳什社会福利的累积损失衡量。
  • Explore-First和Epsilon-Greedy变体的遗憾边界为O(√(KT log T)),与经典MAB设置中的已知边界一致。
  • 对于UCB变体,遗憾边界为O(√(KT log T)),尽管一般N下的优化步骤计算复杂度仍为开放问题。
  • 在多智能体设置中,任何算法的遗憾下界为Ω(√(KT)),表明上界近乎紧致。
  • 使用纳什社会福利可确保比例公平的结果,例如在少数派-多数派偏好情景下,分别为臂分配40%和60%的概率。
  • 本文指出,推导该设置下UCB的实例相关对数遗憾边界仍为开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。