Skip to main content
QUICK REVIEW

[論文レビュー] Near-Optimal Collaborative Learning in Bandits

Clémence Réda, Sattar Vakili|arXiv (Cornell University)|May 31, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿では、重み付きマルチエージェントバンディット設定における協調的最良腕同定の近最適アルゴリズムを提案する。各エージェントは、すべてのエージェントにおけるローカル報酬の重み付き平均として定義される期待混合報酬が最大となる腕を探索する。本手法は、データに依存するサンプリングスキームを用いたフェーズ別排除法を採用し、サンプル複雑性を最小化するとともに通信コストを低く保ち、対数的要因を除いて近最適な性能を達成する。

ABSTRACT

This paper introduces a general multi-agent bandit model in which each agent is facing a finite set of arms and may communicate with other agents through a central controller in order to identify, in pure exploration, or play, in regret minimization, its optimal arm. The twist is that the optimal arm for each agent is the arm with largest expected mixed reward, where the mixed reward of an arm is a weighted sum of the rewards of this arm for all agents. This makes communication between agents often necessary. This general setting allows to recover and extend several recent models for collaborative bandit learning, including the recently proposed federated learning with personalization (Shi et al., 2021). In this paper, we provide new lower bounds on the sample complexity of pure exploration and on the regret. We then propose a near-optimal algorithm for pure exploration. This algorithm is based on phased elimination with two novel ingredients: a data-dependent sampling scheme within each phase, aimed at matching a relaxation of the lower bound.

研究の動機と目的

  • 共通の重み付き混合報酬関数を最適化するマルチエージェントバンディットフレームワークにおける協調的最良腕同定を扱う。
  • 純粋な探索においてサンプル複雑性を最小化するとともに、エージェント間の通信コストを低く保つ。
  • 個人化と協調的バンディット学習を組み込んだ、最近のフェデレーテッドマルチアームバンディットモデルの一般化と拡張。
  • 協調的設定におけるサンプル複雑性とリグレットの新たな理論的下界を導出する。
  • 理論的下界に漸近的に一致する近最適なアルゴリズムの設計と評価。

提案手法

  • 各エージェントの報酬が、既知の重み行列 W によって定義されるすべてのエージェントのローカル報酬の凸結合として定義される重み付き協調バンディットモデルを導入する。
  • 期待混合報酬の推定ギャップに応じて動的にサンプルを割り当てるフェーズ別排除アルゴリズム(W-CPE-BAI)を提案する。
  • 各フェーズ内で理論的下界の緩和版に一致するように、データに依存するサンプリングスキームを組み込む。
  • 理想的なサンプリング割り当てを計算する最適化ベースのオラクルを導入し、アルゴリズムの性能ベンチマークとして用いる。
  • 中央コントローラーを用いて通信を調整し、エージェントが経験的平均を共有し、混合報酬の推定を向上させる。
  • オラクル計算における下位の最適化問題を CVXPY と MOSEK を用いて解き、数値的安定性の確認を実施する。

実験結果

リサーチクエスチョン

  • RQ1重み付き混合報酬モデル下での協調的最良腕同定の根本的サンプル複雑性の限界は何か?
  • RQ2高い信頼性で最適腕を同定しつつ、探索コストを最小化するにはどうすればよいか?
  • RQ3通信効率の良いアルゴリズムは、対数的要因を除いてサンプル複雑性において近最適性を達成できるか?
  • RQ4重み行列 W による個人化は、探索と通信のトレードオフにどのように影響するか?
  • RQ5信頼水準 δ が 0 に近づくに従って、アルゴリズムの性能はどのようにスケーリングするか?

主な発見

  • 提案された W-CPE-BAI アルゴリズムは、PF-UCB-BAI ベースラインと比較して、特に個人化が強い場合(α → 1)に顕著に通信コストを削減する。
  • α = 0.7 の場合、W-CPE-BAI は 10 回の通信で動作するが、PF-UCB-BAI も同様に 10 回の通信を要するが、探索コストは 45,765 と 55,812 よりも 15% 低い。
  • 実際の探索コストと理論的下界(c*/T*)の比は、δ=0.1 のとき 68.0 から δ=0.00001 のとき 11.9 に低下し、強い漸近的スケーリングを示す。
  • アルゴリズムはサンプル複雑性において近最適性を達成しており、δ → 0 のとき c*/T* の比が減少し、理論的上界と整合的である。
  • Δ′_min が小さすぎる場合、オラクル計算に数値的不安定性が生じるため、困難なインスタンスにおいてはロバストなオンライン最適化の必要性が示唆される。
  • すべてのアルゴリズムが小数点以下5桁までゼロの誤差率(δ̂ = 0)を達成しており、最適腕の同定における高い信頼性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。