Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Multi-Armed Bandits with Limited Communication

Mridul Agarwal, Vaneet Aggarwal|arXiv (Cornell University)|Feb 10, 2021
Advanced Bandit Algorithms Research参考文献 24被引用数 16
ひとこと要約

本稿では、限られた通信条件下で累積的後悔を最小化するためのマルチエージェントマルチアームバンディットアルゴリズムであるLCC-UCBおよびLCC-UCB-GRAPHを提案する。エポックを繰り返し、エージェントは唯一の最良アームのインデックス(O(log K)ビット)を共有する。それぞれの後悔は Õ(√((K/N + N)T)) および Õ(D√((K/N + K_G)DT)) であり、通信コストが低く、中央集権的および近隣エージェントのみとの通信戦略を凌駕する。

ABSTRACT

We consider the problem where $N$ agents collaboratively interact with an instance of a stochastic $K$ arm bandit problem for $K \gg N$. The agents aim to simultaneously minimize the cumulative regret over all the agents for a total of $T$ time steps, the number of communication rounds, and the number of bits in each communication round. We present Limited Communication Collaboration - Upper Confidence Bound (LCC-UCB), a doubling-epoch based algorithm where each agent communicates only after the end of the epoch and shares the index of the best arm it knows. With our algorithm, LCC-UCB, each agent enjoys a regret of $ ilde{O}\left(\sqrt{({K/N}+ N)T} ight)$, communicates for $O(\log T)$ steps and broadcasts $O(\log K)$ bits in each communication step. We extend the work to sparse graphs with maximum degree $K_G$, and diameter $D$ and propose LCC-UCB-GRAPH which enjoys a regret bound of $ ilde{O}\left(D\sqrt{(K/N+ K_G)DT} ight)$. Finally, we empirically show that the LCC-UCB and the LCC-UCB-GRAPH algorithm perform well and outperform strategies that communicate through a central node

研究の動機と目的

  • 限られた通信条件下でマルチエージェントマルチアームバンディット問題における累積的後悔を最小化すること。
  • メッセージサイズをO(log K)ビットに制限し、通信ラウンド数をO(log T)に制限することで通信コストを低減すること。
  • 疎な分散ネットワークでも近似的に最適な後悔性能を維持できるスケーラブルなアルゴリズムを設計すること。
  • 完全接続型および疎なグラフトポロジーの両方において、中央ノード通信や近隣ベースのメッセージ伝達戦略を凌駕すること。

提案手法

  • LCC-UCBは、エポックを倍増させる仕組みを採用し、エージェントはアームの部分集合に対してUCBを実行し、エポック終了時に唯一の最良アームのインデックスを共有する。
  • 各エージェントは自身の局所的アーム集合を維持し、各エポック後に他のエージェントから受信したアームインデックスに基づいてそれを更新する。
  • このアルゴリズムは、エポックを経るごとに最良アームと推奨アームの差が縮小するよう保証し、後悔性能を向上させる。
  • LCC-UCB-GRAPHは、疎なグラフへの拡張を図るためにエポックをサブエポックに分割し、各サブフェーズで近隣情報に基づいて更新を行う。
  • LCC-UCB-GRAPHでは、各サブフェーズで近隣から得た更新済みアーム集合を用いてUCBを再起動し、直径Dおよび最大次数K_Gを持つグラフで後悔を低減する。
  • 両アルゴリズムは上界信頼区間(UCB)探索を用い、報酬推定値ではなくアームインデックスのみを共有すれば十分であるという事実を活用する。

実験結果

リサーチクエスチョン

  • RQ1限られた通信条件下で、マルチエージェントバンディットにおいて、理論的下限である Õ(√(KT/N)) に近い後悔を達成できるか?
  • RQ2分散型マルチエージェントバンディット環境において、通信コスト(ビット数およびラウンド数)を最小限に抑えつつ、低後悔を維持する方法は何か?
  • RQ3特に直径Dおよび最大次数K_Gが、疎な通信グラフにおける後悔性能に与える影響は何か?
  • RQ4LCC-UCB-GRAPHにおけるサブエポック通信は、フルエポックまたはラウンドごとの通信戦略に比べ、後悔性能およびスケーラビリティにおいて優れているか?

主な発見

  • LCC-UCBは、 Õ(√((K/N + N)T)) の後悔バウンドを達成し、協調バンディットの理論的下限 Õ(√(KT/N)) に近づく。
  • LCC-UCB-GRAPHは、疎なグラフで Õ(D√((K/N + K_G)DT)) の後悔を達成し、通信複雑度はノードあたりO(K_G D log T)メッセージに制限される。
  • 実験結果では、LCC-UCB-GRAPHは通信なしやラウンドごとの近隣通信戦略を、特にp = 10/Nの疎なグラフにおいて顕著に上回る。
  • K = 250およびN = 100または150の場合、K_Gが低く、1エージェントあたりのアーム数が≤5であるため、LCC-UCB-GRAPHは完全通信戦略と同程度の性能を示す。
  • リレーベースのLCC-UCBに比べ、LCC-UCB-GRAPHは著しく低い後悔を蓄積しており、フルエポック通信に比べてサブエポック更新の利点が明確に示されている。
  • DEMABアルゴリズム(通信ラウンド数がO(N log(NK))に制限)でさえも、通信ラウンド数が少ないにもかかわらず、LCC-UCB-GRAPHはそれを凌駆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。