Skip to main content
QUICK REVIEW

[論文レビュー] Towards Optimal Algorithms for Multi-Player Bandits without Collision Sensing Information

Wei Huang, Richard Combes|arXiv (Cornell University)|Mar 24, 2021
Advanced Bandit Algorithms Research参考文献 17被引用数 5
ひとこと要約

本稿では、衝突検知を必要としない多人数マルチアームバンディットのための新規分散アルゴリズムを提案する。最小アーム報酬に関する事前知識に依存せず、その逆数に比例するレグレットを回避する。アルゴリズムは最悪のアームの期待報酬に依存しないレグレットバウンドを達成し、理論的および実験的に、特に高次元または低信号環境下で最先端手法を著しく上回る性能を発揮する。

ABSTRACT

We propose a novel algorithm for multi-player multi-armed bandits without collision sensing information. Our algorithm circumvents two problems shared by all state-of-the-art algorithms: it does not need as an input a lower bound on the minimal expected reward of an arm, and its performance does not scale inversely proportionally to the minimal expected reward. We prove a theoretical regret upper bound to justify these claims. We complement our theoretical results with numerical experiments, showing that the proposed algorithm outperforms state-of-the-art in practice as well.

研究の動機と目的

  • 既存の多人数バンディットアルゴリズムが最小アーム報酬の下限を必要としているという実用的制限を解消すること。
  • 認知無線ネットワークなどの現実世界の設定において、任意に小さい値を取り得る最悪アームの期待報酬に依存するレグレットを排除すること。
  • アーム数と時間枠のみを入力として使用する完全に分散型のアルゴリズムを設計すること。
  • 最悪アームではなく、M番目と(M+1)番目の最良アームの差(ギャップ)に比例する理論的レグレットバウンドを達成すること。
  • 最悪アームの報酬が小さい場合やプレイヤー数が増加する場合に、SIC-MMAB2およびEC-SICと比較して優れた実験的性能を示すこと。

提案手法

  • 報酬の事前知識なしに高報酬アームを特定する新規分散手順を導入。信頼区間に基づく探索と仮想順位付けを用いる。
  • 二段階アプローチを採用:第一段階では、各プレイヤーが信頼区間探索により有望なアームを特定。第二段階では、仮想マーチャンダイジングを用いて外部順位を割り当てる。
  • アーム選択パターンに基づく分散型カウントメカニズムを用いて、プレイヤー数を推定し、内部順位を割り当てる。
  • 衝突を回避するための協調的仮想割り当てを用いて、分散型探索フェーズを実行し、上位Mアームのうち1つを選択する。
  • アーム選択および推定ステップの高確率正しさを保証するため、信頼水準パラメータδ = 1/(T ln T)を用いる。
  • すべてのモジュールを統合し、K(アーム数)とT(時間枠)のみを入力とする単一のアルゴリズムを構築する。

実験結果

リサーチクエスチョン

  • RQ1アーム間の最小期待報酬に関する事前知識を必要としない多人数バンディットアルゴリズムを設計可能か?
  • RQ2衝突なし多人数バンディットにおけるレグレットは最悪アームの報酬に逆比例するか?その依存関係は排除可能か?
  • RQ3完全に分散型のアルゴリズムが、衝突検知や共有ランダムネスを一切用いずに近似的最適なレグレットを達成可能か?
  • RQ4プレイヤー数や低報酬アームの数が変化する条件下で、このようなアルゴリズムの性能は最先端手法と比べて如何にか?
  • RQ5最悪アームの報酬が非常に小さく、あるいは0に近い場合でも、アルゴリズムの性能は安定を保てるか?

主な発見

  • 提案アルゴリズムは、μ_(K)(すべてのアームにおける最小報酬)に依存しないレグレット上界O(∑_{k>M} ln T / (μ_(M)−μ_k) + K²M ln T + KM² (ln(1/(μ_(M)−μ_(M+1))))² ln T)を達成する。
  • 数値実験では、Kが増加するかμ_(K)が減少する際、SIC-MMAB2およびEC-SICと比較して数個のオーダーも優れている。
  • μ_(K) = 0.001の場合、SIC-MMAB2およびEC-SICは探索を開始できなかったが、提案アルゴリズムは一貫したレグレット性能を維持した。
  • 高衝突環境(例:M=8)では、EC-SICが頻繁な衝突によりMの推定に時間を費やすため、提案アルゴリズムはより速く収束し、性能が優れている。
  • 短い時間枠では若干性能が劣ることがあるが、Tが増加するにつれて常に他の手法を上回り、理論的予測を裏付ける。
  • アルゴリズムの性能はμ_(K)の変化に対して頑健であることが確認され、1/μ_(K)に比例するレグレット依存性がないことが裏付けられ、従来手法の主要な制限を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。