Skip to main content
QUICK REVIEW

[論文レビュー] Best Arm Identification for Contaminated Bandits

Jason M. Altschuler, Victor-Emmanuel Brunel|arXiv (Cornell University)|Feb 26, 2018
Machine Learning and Algorithms参考文献 40被引用数 7
ひとこと要約

本稿は、各アームプルが確率εで任意の汚染分布から汚染されたサンプルを出力する可能性がある状況における、汚染された最良のアーム同定問題(CBAI)を導入する。著者らは、汚染されたデータからロバストなモーメント(中央値および中央偏差平均)を推定するための非漸近的集中不等式を確立し、古典的なBAIアルゴリズムをこの設定に適応させ、タイトなサンプル複雑性の上界および下界を確立し、対数的要因を除いてほぼ最適性であることを示している。

ABSTRACT

This paper studies active learning in the context of robust statistics. Specifically, we propose a variant of the Best Arm Identification problem for \emph{contaminated bandits}, where each arm pull has probability $\varepsilon$ of generating a sample from an arbitrary contamination distribution instead of the true underlying distribution. The goal is to identify the best (or approximately best) true distribution with high probability, with a secondary goal of providing guarantees on the quality of this distribution. The primary challenge of the contaminated bandit setting is that the true distributions are only partially identifiable, even with infinite samples. To address this, we develop tight, non-asymptotic sample complexity bounds for high-probability estimation of the first two robust moments (median and median absolute deviation) from contaminated samples. These concentration inequalities are the main technical contributions of the paper and may be of independent interest. Using these results, we adapt several classical Best Arm Identification algorithms to the contaminated bandit setting and derive sample complexity upper bounds for our problem. Finally, we provide matching information-theoretic lower bounds on the sample complexity (up to a small logarithmic factor).

研究の動機と目的

  • 確率εで任意の汚染にさらされる報酬がある状況において、最良のアームを同定する課題に対処すること。
  • 真の分布が汚染のため完全に同定不能となるため、真の中央値およびMADが無限サンプルでも完全に回復できないという部分的同定可能性の概念を導入し、CBAIと呼ばれる新しいバンディット設定を形式化すること。
  • 汚染されたサンプルから中央値および中央偏差平均(MAD)を推定するための非漸近的統計的保証を確立すること。
  • 古典的な最良のアーム同定(BAI)アルゴリズムをCBAI設定に適応し、保証可能なサンプル複雑性境界を提供すること。
  • 情報理論的下界を提供し、提案されたアルゴリズムの近似的最適性を確立すること。

提案手法

  • 汚染プロセスを混合モデルとして定式化:確率1−εで真のアーム分布F_iから、確率εで任意の汚染分布G_i,tからサンプルが得られる。
  • 敵対的汚染の下で、無限サンプルでも真の中央値およびMADが完全に回復できないという、部分的同定可能性の概念を導入する。
  • 無知な敵、事前知識を持つ敵、悪意ある敵の3種類の敵に対して、中央値およびMAD推定のためのタイトな非漸近的集中不等式を導出する。
  • 標準的なギャップに基づく解析を、汚染に起因する不確実性を反映した有効ギャップに置き換えることで、古典的BAIアルゴリズム(例:逐次除外法)をCBAI設定に適応する。
  • 和集合の不等式とロバスト推定の保証を用いて、選択されたアームの中央値およびMADの高確率的信頼区間を導出する。
  • 古典的BAIの下界を拡張するためのリフトリング技術を用いて、CBAI設定における一致する下界を確立する。

実験結果

リサーチクエスチョン

  • RQ1各アームプルが確率εで汚染される場合、最良のアームを同定するための根本的なサンプル複雑性は何か?
  • RQ2敵対的汚染下で、中央値およびMADといったロバスト統計推定量を、汚染されたサンプルから信頼性高く推定するにはどうすればよいか?
  • RQ3古典的な最良のアーム同定アルゴリズムを、保証可能なサンプル複雑性境界を伴って汚染されたバンディット設定に適応できるか?
  • RQ4この設定において、信頼度、非最適性ギャップ、汚染レベルの間の最適なトレードオフは何か?
  • RQ5CBAIの情報理論的下界は、提案されたアルゴリズムの上界と比較してどうなっているか?

主な発見

  • 本稿では、無知な敵、事前知識を持つ敵、悪意ある敵のすべての状況において、汚染されたサンプルからの中央値推定の非漸近的集中不等式を確立した。
  • 中央値に関しては、固定信頼度の下でサンプル複雑性がO((1/ε²) log(1/δ))で上界に抑えられ、汚染レベルεに依存する。
  • 中央偏差平均(MAD)に関しては、2次のロバストモーメントが推定可能な分布のクラスにおいて、集中結果を導出した。
  • 適応されたBAIアルゴリズムは、CBAI問題においてO((1/ε²) log(k/δ))のサンプル複雑性上界を達成し、下界と対数的要因を除いて一致する。
  • 著者らは、選択されたアームの品質保証(具体的には中央値およびMADの境界)が、純粋な同定に要するサンプル数に僅かに多く必要なだけのサンプル数で達成可能であることを示した。
  • 情報理論的下界は、アーム数の対数的要因を除いて上界と一致しており、提案されたアルゴリズムの近似的最適性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。