Skip to main content
QUICK REVIEW

[論文レビュー] Selfish Robustness and Equilibria in Multi-Player Bandits

Étienne Boursier, Vianney Perchet|arXiv (Cornell University)|Feb 4, 2020
Advanced Bandit Algorithms Research参考文献 44被引用数 5
ひとこと要約

本論文は、集団の利益を最大化するのではなく個々の報酬を最大化する利己的プレイヤーに対しても耐性を示し、対数的レジーットを達成する最初のマルチプレイヤー・マルチアームバンディット用のアルゴリズムを紹介する。衝突の観測を用いた罰則に基づくメカニズムを提案し、協力を強制することで、同種および異種の設定の両方でほぼ最適なレジーットを達成する。

ABSTRACT

Motivated by cognitive radios, stochastic multi-player multi-armed bandits gained a lot of interest recently. In this class of problems, several players simultaneously pull arms and encounter a collision - with 0 reward - if some of them pull the same arm at the same time. While the cooperative case where players maximize the collective reward (obediently following some fixed protocol) has been mostly considered, robustness to malicious players is a crucial and challenging concern. Existing approaches consider only the case of adversarial jammers whose objective is to blindly minimize the collective reward. We shall consider instead the more natural class of selfish players whose incentives are to maximize their individual rewards, potentially at the expense of the social welfare. We provide the first algorithm robust to selfish players (a.k.a. Nash equilibrium) with a logarithmic regret, when the arm performance is observed. When collisions are also observed, Grim Trigger type of strategies enable some implicit communication-based algorithms and we construct robust algorithms in two different settings: the homogeneous (with a regret comparable to the centralized optimal one) and heterogeneous cases (for an adapted and relevant notion of regret). We also provide impossibility results when only the reward is observed or when arm means vary arbitrarily among players.

研究の動機と目的

  • プレイヤーが協調的ではなく利己的に行動する場合に、マルチプレイヤー・バンディットアルゴリズムのロバスト性が欠如しているという問題に対処すること。
  • 一部のプレイヤーが自身の報酬を最大化するために逸脱しても、低レジーットを維持できる分散型アルゴリズムを設計すること。
  • 利己的ロバスト性と非線形レジーットが同時に達成可能な条件を確立すること。
  • 部分的フィードバックを伴う分散型マルチプレイヤー・バンディットの文脈において、ナッシュ均衡の概念を形式化し、分析すること。
  • 報酬のみが観測可能である場合、またはアームの平均がプレイヤー間で任意に変化する場合の不可能性結果を示すこと。

提案手法

  • 固定時間 $T_{\text{punish}}$ 経過後に発動する罰則プロocolを導入。協力的プレイヤーは濃度不等式を用いて高確率でアームの平均を推定する。
  • グリム・トリガー戦略を採用:プレイヤーが逸脱(例:他のプレイヤーと衝突)していることが観測された場合、他の全プレイヤーが逸脱者の好むアームを避ける罰則フェーズに移行する。
  • 観測された衝突を活用して暗黙の通信を可能にし、共通の割り当てに合意することで、分散性にもかかわらず集団的学習を可能にする。
  • 均等なランダム初期化フェーズを導入し、役割(例:最良アームを選択する「独裁者」)を一様ランダムに割り当てることで、公平性を確保し、操作を防ぐ。
  • 罰則メカニズム下での利己的プレイヤーの期待報酬に対する境界を導出し、最適個別報酬の定数倍($ ilde{\theta}$)を超えないことを示す。
  • $ ho$-非均一性仮定を活用して、プレイヤー間の平均比をバインドし、異なる好みのもとでのレジーット分析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1分散型マルチプレイヤー・バンディットアルゴリズムは、衝突が観測可能である場合に、利己的プレイヤーが自身の報酬を最大化する行動を取る状況でも、対数的レジーットを達成可能か?
  • RQ2直接的な通信がなく、部分的フィードバックを伴うマルチプレイヤー・バンディットにおいて、部分的フィードバック下でナッシュ均衡を設計可能か?
  • RQ3協調が不可能な状況下で、観測された衝突をどのように活用して暗黙の通信を可能にし、協力を強制できるか?
  • RQ4衝突情報が得られない状況(報酬のみ観測可能)では、利己的ロバスト性の根本的限界は何か?
  • RQ5アームの平均がプレイヤー間で任意に変化する場合、非均一設定において、非線形レジーットを達成可能か?

主な発見

  • 提案された Selfish-Robust MMAB アルゴリズムは、衝突が観測可能であり、$ ho$-非均一性仮定が成り立つ場合、利己的プレイヤーが存在する状況でも対数的レジーットを達成する。
  • 同種設定では、アルゴリズムは中央集権的最適解と同等のレジーットを達成し、対数的要因の差異にとどまる。
  • 非均一設定では、アルゴリズムにより、利己的プレイヤーが最適個別報酬を定数倍($ ilde{\theta} = \tilde{\theta}(\rho)$)を超えて得ることはできない。
  • 不可能性結果を証明:報酬のみが観測可能である場合、非線形レジーットと利己的ロバスト性の両立は保証できない。
  • 別の不可能性結果として、アームの平均がプレイヤー間で任意に変化する場合、非線形レジーットと利己的ロバスト性の両立は不可能であることを示した。
  • 罰則メカニズムは、悪意ある行動に対しても、利己的プレイヤーの利益を最適個別報酬の定数倍に制限する効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。