Skip to main content
QUICK REVIEW

[論文レビュー] Fair Algorithms for Multi-Agent Multi-Armed Bandits

Safwan Hossain, Evi Micha|arXiv (Cornell University)|Jul 13, 2020
Advanced Bandit Algorithms Research参考文献 33被引用数 16
ひとこと要約

本稿は、各エージェントがアームに対して異なる確率的報酬を割り当てるマルチエージェント・マルチアームバンディットフレームワークを導入し、公平性基準としてナッシュ社会的厚生(NSW)を最大化する公平な学習アルゴリズムを提案する。Explore-First、イプシロン・グリーディ、UCBのマルチエージェント版を設計し、失われたNSWの観点からサブラインアーレグレギュレートを達成することを証明。これにより、異なる好みを持つエージェント間で、長期間にわたりアームの選択が公平に分配されることを保証する。

ABSTRACT

We propose a multi-agent variant of the classical multi-armed bandit problem, in which there are $N$ agents and $K$ arms, and pulling an arm generates a (possibly different) stochastic reward for each agent. Unlike the classical multi-armed bandit problem, the goal is not to learn the "best arm"; indeed, each agent may perceive a different arm to be the best for her personally. Instead, we seek to learn a fair distribution over the arms. Drawing on a long line of research in economics and computer science, we use the Nash social welfare as our notion of fairness. We design multi-agent variants of three classic multi-armed bandit algorithms and show that they achieve sublinear regret, which is now measured in terms of the lost Nash social welfare.

研究の動機と目的

  • アームに対するエージェント間の対立する好みがあるマルチエージェント意思決定における公平性を扱う。
  • 企業意思決定やカンferー承認システムなど、複数のステークホルダーに影響を与える状況における集団的ポリシー選択をモデル化する。
  • ユーティタリアン的またはエゴイスト的公平性を、バランスの取れた公平性基準としてのナッシュ社会的厚生に置き換える。
  • 未知の報酬分布にかかわらず、NSWを最大化するアームの確率分布に収束する学習アルゴリズムを設計する。
  • 失われたナッシュ社会的厚生の観点から、時間枠Tに応じてサブラインアーレグレートが成長するよう、レギュレートバウンドを確立する。

提案手法

  • エージェント固有の報酬を持つマルチエージェント設定に、古典的マルチアームバンディットアルゴリズム(Explore-First、イプシロン・グリーディ、UCB)を適応する。
  • レギュレートを、最適なアーム分布に対するナッシュ社会的厚生の累積的損失として定義する。
  • エージェント固有報酬の経験的平均推定値を用いてアーム選択をガイドし、収束を保証するための探索バランスをとる。
  • UCBでは、推定NSWと探索ボーナスを組み合わせた上界信頼区間を導入し、活用と探索のバランスを取る。
  • UCBの変種では、効率的な最適化を可能にするためにNSWの対数変換を用いるが、レギュレートバウンドは元のNSW関数に対して導出される。
  • 提案されたアルゴリズムが、時間Tに応じてサブラインアーレグレートを達成することを証明。エージェントごとの報酬の非同一性がある場合でも、Tより遅い速度でレギュレートが増加することが保証される。

実験結果

リサーチクエスチョン

  • RQ1対立する好みを持つエージェントに対して、公平性を達成するマルチエージェント・マルチアームバンディットの学習アルゴリズムを設計できるか?
  • RQ2ナッシュ社会的厚生を最大化することは、大多数の意見に圧倒されず、少数派の好みを尊重する公平なアーム選択の分配をもたらすか?
  • RQ3古典的バンディットアルゴリズムを、失われたナッシュ社会的厚生の観点からサブラインアーレグレートを維持できるように適応できるか?
  • RQ4提案されたアルゴリズムのレギュレートは、エージェント数やアーム数に応じて滑らかにスケーリングされるか?
  • RQ5このマルチエージェント公平性設定におけるレギュレートの理論的限界は何か?より鋭い下界を導出できるか?

主な発見

  • 提案されたExplore-First、イプシロン・グリーディ、UCBのマルチエージェント版は、いずれも時間枠Tに応じてサブラインアーレグレートを達成する。これは、ナッシュ社会的厚生の累積的損失として測定される。
  • Explore-Firstおよびイプシロン・グリーディの変種におけるレギュレートバウンドはO(√(KT log T))であり、古典的MAB設定での既知のバウンドと一致する。
  • UCBの変種では、レギュレートがO(√(KT log T))でバウンドされるが、一般のNに対して最適化ステップの計算複雑性は未解決のままである。
  • 任意のアルゴリズムに対して、マルチエージェント設定でΩ(√(KT))の下界が確立され、上界がほぼタイトであることが示された。
  • ナッシュ社会的厚生の使用により、割合的に公平な結果が保証され、少数派・大多数の好みの状況では、40%と60%の確率でアームが割り当てられる。
  • 本稿では、この設定におけるUCBのインスタンス依存の対数レギュレートバウンドを導出することは、未解決の問題であると特定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。