Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Multiple-Arm Identification

Jiecao Chen, Xi Chen|arXiv (Cornell University)|Jun 4, 2017
Mobile Crowdsensing and Crowdsourcing参考文献 13被引用数 7
ひとこと要約

本稿では、集積的リグレットを伴う確率的マルチアームバンディット設定において、トップ-K アームを特定するための適応的アルゴリズムを提案する。新たなインスタンス依存のハードネスパラメータを導入することで、顕著に改善されたサンプル複雑度を達成する。提案された AdaptiveTopK アルゴリズムは、各インスタンスの難易度に適応し、インスタンスに依存しない下界まで log(ε⁻¹) 要因の差異を除いて近似的に最適な性能を達成する。

ABSTRACT

We study the problem of selecting $K$ arms with the highest expected rewards in a stochastic $n$-armed bandit game. This problem has a wide range of applications, e.g., A/B testing, crowdsourcing, simulation optimization. Our goal is to develop a PAC algorithm, which, with probability at least $1-δ$, identifies a set of $K$ arms with the aggregate regret at most $ε$. The notion of aggregate regret for multiple-arm identification was first introduced in \cite{Zhou:14} , which is defined as the difference of the averaged expected rewards between the selected set of arms and the best $K$ arms. In contrast to \cite{Zhou:14} that only provides instance-independent sample complexity, we introduce a new hardness parameter for characterizing the difficulty of any given instance. We further develop two algorithms and establish the corresponding sample complexity in terms of this hardness parameter. The derived sample complexity can be significantly smaller than state-of-the-art results for a large class of instances and matches the instance-independent lower bound upto a $\log(ε^{-1})$ factor in the worst case. We also prove a lower bound result showing that the extra $\log(ε^{-1})$ is necessary for instance-dependent algorithms using the introduced hardness parameter.

研究の動機と目的

  • 高確率 (1−δ) で ϵ-トップ-K アーム集合を識別できる PAC アルゴリズムを設計し、最小限のサンプル複雑度を達成すること。
  • アームの平均値のギャップ構造に基づいて、トップ-K アームを特定する際の本質的難易度を捉える新しいハードネスパラメータを導入すること。
  • 観測データに基づいて動的にサンプリングを調整する適応的アルゴリズムを設計し、OptMAI のような非適応的手法を凌駒すること。
  • 従来の研究と比較して多くの問題インスタンスにおいて顕著に小さい、タイトなインスタンス依存のサンプル複雑度バウンドを確立すること。
  • 提案されたハードネスパラメータを用いたインスタンス依存アルゴリズムにおいて、サンプル複雑度に含まれる log(ε⁻¹) 要因が必須であることを示す下界を証明すること。

提案手法

  • 平均ギャップと信頼水準に基づいて、トップ-K アームとそれ以外を区別する難易度を定量化する新しいハードネスパラメータ H^(t,ε) を導入する。
  • 自信区間とハードネスパラメータに基づく動的拒否/受容ルールを用いる、適応的サンプリング戦略である AdaptiveTopK (アルゴリズム 1) を設計する。
  • Hoeffding の不等式を用いた逐次仮説検定により、アームの誤分類確率をバウンディングする。
  • 信頼度が高い場合に複数のアームを同時に受容または拒否できるグループベースのサンプリング戦略を内側のループで適用する。
  • 新しいハードネスパラメータを用いてサンプル複雑度バウンディングを導出し、最悪ケースの仮定ではなくインスタンス固有のギャップに依存することを示す。
  • アルゴリズムの最適性を示すために、一致するインスタンス依存の下界を証明する。

実験結果

リサーチクエスチョン

  • RQ1トップ-K アーム同定のための適応的アルゴリズムを設計できるか? その場合、非適応的手法よりも顕著に優れたインスタンス依存のサンプル複雑度を達成できるか?
  • RQ2平均ギャップと信頼水準に基づいて、トップ-K アームを特定する際の本質的難易度を捉える適切なハードネスパラメータは何か?
  • RQ3提案されたハードネスパラメータに基づく適応的アルゴリズムのサンプル複雑度は、既存のインスタンスに依存しないバウンディングと比較してどのようにスケーリングされるか?
  • RQ4提案されたハードネスパラメータを用いたインスタンス依存アルゴリズムにおいて、サンプル複雑度に含まれる log(ε⁻¹) 要因は必須か?
  • RQ5提案されたアルゴリズムは、K の値やさまざまなデータ分布において、最先端の手法(CLUCB-PAC や OptMAI)を上回る性能を示せるか?

主な発見

  • 提案された AdaptiveTopK アルゴリズムは、全テストデータセットにおいて CLUCB-PAC や OptMAI を上回る性能を示し、K が大きい場合やアームが明確に分離されている場合に顕著に優れている。
  • TwoGroup データセットでは、内側の while ループによるバッチ分類により、明確に分離されたトップアームを素早く特定できるため、他のアルゴリズムと比べ顕著に優れている。
  • K が増加するにつれて、ハードネスパラメータ H^(t,ε) が減少し、サンプル複雑度が改善される。これは、AdaptiveTopK が OptMAI に対してますます優位になる理由を説明している。
  • アルゴリズムは、アームが明確に分離されている場合や、K 番目の閾値に近い場合に、状態の最先端の結果よりも厳密に小さいインスタンス依存のサンプル複雑度を達成する。
  • 理論的サンプル複雑度は、インスタンスに依存しない下界まで log(ε⁻¹) 要因の差異を除いて一致しており、最悪ケースにおいて近似的に最適であることを示している。
  • 下界を証明し、提案されたハードネスパラメータを用いた任意のインスタンス依存アルゴリズムにおいて、log(ε⁻¹) 要因が必須であることを示しており、解析のタイトさを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。