Skip to main content
QUICK REVIEW

[論文レビュー] Collaborative Top Distribution Identifications with Limited Interaction

Nikolai Karpov, Qin Zhang|arXiv (Cornell University)|Apr 20, 2020
Advanced Bandit Algorithms Research参考文献 59被引用数 4
ひとこと要約

本稿では、$K$ 個のエージェント間での限られた相互作用を用いて、平均が最大の $m$ 個の腕(分布)を特定する最適な協調的アルゴリズムを提示する。$\tilde{O}(H^{\langle m\rangle}/K)$ の近似的最適な実行時間と $O(\log(1/\Delta^{\langle m\rangle}))$ ラウンドを達成する。実行時間とラウンド数のタイトなトレードオフを確立し、トップ-$m$ とトップ-1 の識別、および固定時間と固定信頼度の設定の間の根本的な複雑さの差を明らかにする。

ABSTRACT

We consider the following problem in this paper: given a set of $n$ distributions, find the top-$m$ ones with the largest means. This problem is also called {\em top-$m$ arm identifications} in the literature of reinforcement learning, and has numerous applications. We study the problem in the collaborative learning model where we have multiple agents who can draw samples from the $n$ distributions in parallel. Our goal is to characterize the tradeoffs between the running time of learning process and the number of rounds of interaction between agents, which is very expensive in various scenarios. We give optimal time-round tradeoffs, as well as demonstrate complexity separations between top-$1$ arm identification and top-$m$ arm identifications for general $m$ and between fixed-time and fixed-confidence variants. As a byproduct, we also give an algorithm for selecting the distribution with the $m$-th largest mean in the collaborative learning model.

研究の動機と目的

  • 最小限の通信ラウンドで、複数エージェントの協調的設定において平均が最大の $m$ 個の分布を特定する課題に対処すること。
  • 限られた相互作用下での協調学習における実行時間と通信ラウンド数のトレードオフを特定すること。
  • トップ-$m$ とトップ-1 の腕識別、および固定時間と固定信頼度のバリアントの間の複雑さの分離を確立すること。
  • 通信が高コストであっても、近似的最適な実行時間を達成しながらラウンド数を最小限に抑えるアルゴリズムを設計すること。
  • 協調モデルにおいて $m$ 番目に大きな平均を持つ分布を効率的に特定する方法を提供すること。

提案手法

  • エージェントは、経験的平均と信頼区間に基づいて、候補となる腕の集合を反復的に精錬する再帰的排除フレームワークを用いる。
  • 各ラウンド $r$ において、エージェントは $I_r$ 内の腕を $T_r = O(\log(1/\delta)/(K\epsilon_r^2))$ 回のプルでサンプリングする。ここで $\epsilon_r$ は幾何的に減少する。
  • 各ラウンドの終了時にエージェントは通信を行い、信頼区間に基づいてトップ-$m$ に含まれ unlikely な腕を除外したアクティブセット $I_{r+1}$ を更新する。
  • アルゴリズムは三つの不変条件を維持する:$m_r = |\text{Top}_m \cap I_r|$、$\text{Acc}_r \subseteq \text{Top}_m$、および $\text{Rej}_r \subseteq I \setminus \text{Top}_m$。
  • 濃度不等式(Hoeffdingの不等式)を用いて高確率での正しさを保証し、ラウンドおよび腕全体にわたる和集合によるバウンドで誤差を制御する。
  • 停止条件は、すべての腕について $\epsilon_r \leq \Delta^{\langle m\rangle}_i / 4$ となる場合に発動し、これによりすべてのトップ-$m$ 腕が正しく同定される。

実験結果

リサーチクエスチョン

  • RQ1協調的トップ-$m$ 腕識別において、実行時間と通信ラウンド数の最適なトレードオフは何か?
  • RQ2マルチエージェント設定において、トップ-$m$ 腕識別とトップ-1 腕識別の複雑さはどのように異なるか?
  • RQ3固定時間と固定信頼度のバリアントにおいて、トップ-$m$ 腕識別のラウンド複雑度を分離できるか?
  • RQ4限られた相互作用を伴う協調的設定で、$m$ 番目に大きな平均を持つ腕を効率的に特定する方法はあるか?
  • RQ5協調学習における近似的な最適スピードアップを達成するために必要な最小ラウンド数は何か?

主な発見

  • 提案されたアルゴリズムは、$O\left(\frac{H^{\langle m\rangle}}{K}\log\left(\frac{n}{\delta}\log H^{\langle m\rangle}\right)\right)$ の実行時間と $O(\log(1/\Delta^{\langle m\rangle}))$ ラウンドを達成し、対数的要因を除いて下界と一致する。
  • イベント $\mathcal{E}_3$ の下で、アルゴリズムは確率 $1-\delta$ 以上でトップ-$m$ 腕を正しく同定する。$\mathcal{E}_3$ は高確率で成立する。
  • トップ-$m$ とトップ-1 の腕識別には複雑さの分離が存在する:$m > 1$ の場合、トップ-$m$ のラウンド複雑度はトップ-1 よりも厳密に高い。
  • 固定信頼度バリアントのトップ-$m$ 腕識別は、$\Omega(\log(1/\Delta^{\langle m\rangle}))$ ラウンドを必要とし、上界と一致するため、タイトであることが示される。
  • アルゴリズムは、ラウンドにわたる精錬されたアクティブセットを維持することにより、$m$ 番目に大きな平均を持つ腕の同定も可能である。
  • 実行時間の複雑さは対数的要因を除いて最適であり、ラウンド複雑さは協調学習における近似的な完全スピードアップを達成する上でタイトである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。