Skip to main content
QUICK REVIEW

[論文レビュー] Multiplayer Multi-armed Bandits for Optimal Assignment in Heterogeneous Networks

Harshvardhan Tibrewal, Sravan Patchala|arXiv (Cornell University)|Jan 12, 2019
Advanced Bandit Algorithms Research参考文献 22被引用数 7
ひとこと要約

本稿では、同じアームで異なる報酬を経験するが直接通信できないプレイヤーが参加する非均質なネットワークにおける最適な割り当てを実現する分散型マルチプレイヤー多腕バンディットアルゴリズムを提案する。探索とコミット戦略および探索・信号送信・活用(ESE)フレームワークを用い、送信パターンによる信号伝送により、対数的 regret と高い確率で近似的に最適な割り当てを達成する。実験では、CSM-MAB や dE³ といった最先端手法を上回る性能を示した。

ABSTRACT

We consider an ad hoc network where multiple users access the same set of channels. The channel characteristics are unknown and could be different for each user (heterogeneous). No controller is available to coordinate channel selections by the users, and if multiple users select the same channel, they collide and none of them receive any rate (or reward). For such a completely decentralized network we develop algorithms that aim to achieve optimal network throughput. Due to lack of any direct communication between the users, we allow each user to exchange information by transmitting in a specific pattern and sense such transmissions from others. However, such transmissions and sensing for information exchange do not add to network throughput. For the wideband sensing and narrowband sensing scenarios, we first develop explore-and-commit algorithms that converge to near-optimal allocation with high probability in a small number of rounds. Building on this, we develop an algorithm that gives logarithmic regret, even when the number of users changes with time. We validate our claims through extensive experiments and show that our algorithms perform significantly better than the state-of-the-art CSM-MAB, dE3 and dE3-TS algorithms.

研究の動機と目的

  • 非均質な報酬と中央集権的調整なしの分散型最適割り当てを解決すること。
  • プレイヤーが個々のアーム報酬を学習し、直接通信を行わず信号伝送により衝突を回避し、ネットワーク全体の報酬を最大化すること。
  • 完全に分散された環境において、非線形(対数的)の regret を達成する高確率での近似的に最適な割り当てを実現すること。
  • プレイヤーの参加・退出が可能な動的環境へフレームワークを拡張すること。
  • ネットワーク報酬を低下させることなく情報交換を可能にする耐障害性の高い信号伝送方式の開発。

提案手法

  • 探索とコミット戦略を用い、高確率で有限時間内に近似的に最適な割り当てに収束する。
  • エポックに分けた探索・信号送信・活用の段階を組み合わせた Explore-Signal-Exploit (ESE) アルゴリズムを導入する。
  • ベルヌーイ信号送信またはパケット化信号送信を用い、送信パターンを通じてプレイヤー間で推定報酬を交換する。
  • ホフディングの不等式を用い、探索および信号送信段階における推定誤差を制限する。
  • 二段階の信号送信方式を採用:局所的推定のための共有聴取(SH)と、グローバルな情報交換のためのブロードキャスト信号送信(BS)。
  • すべてのプレイヤーが共通の推定報酬行列を構築することで、一貫性のある最適割り当て計算を保証する。

実験結果

リサーチクエスチョン

  • RQ1報酬がプレイヤー間で非均質な分散型マルチプレイヤーバンディットシステムは、近似的に最適な割り当てを達成可能か?
  • RQ2直接通信ができない状況で、プレイヤーはどのように衝突を回避し、総報酬を最大化するか?
  • RQ3ネットワーク報酬を低下させることなく、正確で低コストな情報交換を可能にする信号伝送メカニズムは何か?
  • RQ4未知の非均質な報酬を持つ完全に分散された環境でも、対数的 regret を達成できるか?
  • RQ5プレイヤーの参加・退出が可能な動的環境に適応できるか?

主な発見

  • DOA-WS方策は、高確率 $1 - \delta$ で $T_r + K T_s + K T_b$ ラウンド後に $(\epsilon, \delta)$-最適性を達成する。
  • ESEアルゴリズムは、エポックサイズを段階的に増大させながら、探索・信号送信・活用の段階を統合し、近似的に対数的 regret を達成する。
  • ESE1バージョンは、信号送信および探索段階の最適化により、最適な対数的 regret 界を達成する。
  • アルゴリズムは推定報酬行列 $\hat{M}$ が高確率で $|\hat{M} - M| \leq \epsilon I / (2N)$ を満たすことを保証し、近似的に最適な割り当てを実現する。
  • 広範な実験により、提案手法は CSM-MAB や dE³、dE³-TS といった最先端手法を顕著に上回ることが示された。
  • パケット化信号送信はベルヌーイ信号送信に比べて情報交換に要する時間スロットを削減するが、誤り率は高くなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。