Skip to main content
QUICK REVIEW

[論文レビュー] Sample complexity of partition identification using multi-armed bandits

Sandeep Juneja, Subhashini Krishnasamy|arXiv (Cornell University)|Nov 14, 2018
Machine Learning and Algorithms参考文献 17被引用数 5
ひとこと要約

本稿では、1パラメータ指数型分布族に属するK個の確率分布からなるベクトルの正しい分割を特定するためのサンプル複雑度を、マルチアームバンディットサンプリングを用いて研究する。幾何的構造(例:半空間、多面体、凸集合)に基づいた問題依存のサンプル複雑度の下界を導出し、しきい値ベースの停止ルールを備えたD-Trackingサンプリングルールを提案し、誤差確率δ→0の下でアルゴリズムの漸近的最適性を証明する。

ABSTRACT

Given a vector of probability distributions, or arms, each of which can be sampled independently, we consider the problem of identifying the partition to which this vector belongs from a finitely partitioned universe of such vector of distributions. We study this as a pure exploration problem in multi armed bandit settings and develop sample complexity bounds on the total mean number of samples required for identifying the correct partition with high probability. This framework subsumes well studied problems such as finding the best arm or the best few arms. We consider distributions belonging to the single parameter exponential family and primarily consider partitions where the vector of means of arms lie either in a given set or its complement. The sets considered correspond to distributions where there exists a mean above a specified threshold, where the set is a half space and where either the set or its complement is a polytope, or more generally, a convex set. In these settings, we characterize the lower bounds on mean number of samples for each arm highlighting their dependence on the problem geometry. Further, inspired by the lower bounds, we propose algorithms that can match these bounds asymptotically with decreasing probability of error. Applications of this framework may be diverse. We briefly discuss one associated with finance.

研究の動機と目的

  • 高確率でK次元の平均ベクトルの正しい分割を特定するために必要な最小期待サンプル数を特定すること。
  • 既存の純粋探索バンディットフレームワークを、最良腕や上位r腕選択を超える一般化された分割同定問題へと拡張すること。
  • 分割集合の幾何的構造に依存するタイトな問題依存下界をサンプル複雑度に対して導出すること。
  • 1パラメータ指数型分布族の仮定の下で、これらの下界に漸近的に一致するδ-PACアルゴリズムを設計すること。
  • D-Trackingサンプリングルールと対数的サンプル複雑度スケーリングを有するしきい値ベースの停止ルールを通じて収束性と正しさを保証すること。

提案手法

  • 分割同定(PI)問題を、真の平均ベクトルが有限個の互いに素な集合のいずれに属するかを同定することを目的とするマルチアームバンディットにおける純粋探索タスクとして定式化する。
  • GarivierとKaufmann(2016)が提示した輸送不等式を用い、サンプル複雑度の下界問題を無限個の制約を持つ制約付き最適化問題に変換する。
  • 各アームの分布が1パラメータ指数型分布族に属すると仮定したもとで、しきい値超過、半空間、多面体、凸集合といった特定の幾何的設定に対して下界問題を解く。
  • 推定された最適サンプリング割合を維持するように適応的にサンプルを割り当てるD-Trackingサンプリングルールを提案し、カウントが低い場合に強制的にサンプリングを行うことで十分な探索を保証する。
  • Kullback-Leibler発散のしきい値に基づく停止ルールを採用:tとδに依存する対数的しきい値を超えて、誤った分割の境界への経験的発散が増加した時点で停止する。
  • 期待停止時刻T_U(δ)がlim sup_{δ→0} E[T_U(δ)] / log(1/δ) ≤ T*(μ)を満たすことを示すことで、漸近的最適性を証明する。ここでT*(μ)は導出された下界である。

実験結果

リサーチクエスチョン

  • RQ1マルチアームバンディット設定において、高確率で正しい分割を特定するために必要なサンプル数の根本的下界は何か?
  • RQ2半空間、多面体、または凸集合といった分割集合の幾何的構造は、分割同定のサンプル複雑度にどのように影響を与えるか?
  • RQ3さまざまな分割構造に対して、導出された下界に漸近的に一致するδ-PACアルゴリズムを設計できるか?
  • RQ4どのようなサンプリングおよび停止ルールが、サンプル複雑度の観点でδ-PAC保証と漸近的最適性を両立させるか?
  • RQ5下界問題の最適解が一意に定まる条件は何か、そしてその条件がアルゴリズム設計にどのように影響を与えるか?

主な発見

  • しきい値超過問題において、サンプル複雑度の下界は、真の平均ベクトルが最大平均がしきい値を超える集合に属するか否かに応じて、本質的な非対称性を示す。
  • しきい値超過、半空間、多面体設定に対して下界問題が明示的に解かれており、最適サンプリング割合は分割境界の幾何的構造に依存する。
  • 分割境界が閉凸集合の滑らかな点である場合、下界問題の最適解は一意であるため、アルゴリズムの漸近的最適性が保証される。
  • 提案されたアルゴリズムは漸近的に最適である:lim sup_{δ→0} E[T_U(δ)] / log(1/δ) ≤ T*(μ)、ここでT*(μ)は情報理論的下界である。
  • D-Trackingサンプリングルールにより、各アームが十分に頻繁にサンプリングされる(Ω(√t))ことが保証され、tが増加するにつれて経験的サンプリング割合が最適割合に収束する。
  • 停止ルールはβ(t,δ) = log(ct/δ)というしきい値に基づくもので、誤った分割の境界への経験的発散との比較により、δ-PACの正しさが保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。