Skip to main content
QUICK REVIEW

[論文レビュー] Sequential Test for the Lowest Mean: From Thompson to Murphy Sampling

Emilie Kaufmann, Wouter M. Koolen|arXiv (Cornell University)|Jun 4, 2018
Machine Learning and Algorithms被引用数 13
ひとこと要約

本稿では、有限個の分布の平均の最小値が閾値未満または超過であるかどうかを、効率的にテストするための新しい逐次的サンプリング戦略であるMurphy Samplingを提案する。Thompson Samplingを最悪ケースの仮説(µ∗ < γ)に条件づけることで、真の最小値が低いか高いかにかかわらず最適なサンプリング行動を達成し、強制的探索を用いない。また、早期停止を可能にするために、自己正規化された乖離不等式を高度に開発する。この手法はδ-correctであることが証明されており、既存の手法を実験的に上回る性能を示す。

ABSTRACT

Learning the minimum/maximum mean among a finite set of distributions is a fundamental sub-task in planning, game tree search and reinforcement learning. We formalize this learning task as the problem of sequentially testing how the minimum mean among a finite set of distributions compares to a given threshold. We develop refined non-asymptotic lower bounds, which show that optimality mandates very different sampling behavior for a low vs high true minimum. We show that Thompson Sampling and the intuitive Lower Confidence Bounds policy each nail only one of these cases. We develop a novel approach that we call Murphy Sampling. Even though it entertains exclusively low true minima, we prove that MS is optimal for both possibilities. We then design advanced self-normalized deviation inequalities, fueling more aggressive stopping rules. We complement our theoretical guarantees by experiments showing that MS works best in practice.

研究の動機と目的

  • 有限個の分布の平均の最小値が与えられた閾値未満または超過であるかどうかを、効率的かつ信頼性高く特定する問題に対処すること。
  • 強制的探索に依存せず、サンプル複雑度を最小化するδ-correctな逐次的テストアルゴリズムを開発すること。
  • 真の最小値が低い場合と高い場合の両方において、逐次的最小平均テストにおける最適なサンプリング割り当てを特定すること。
  • 指数型分布族に対して自己正規化された乖離不等式に基づく、新たな停止ルールを設計し、最小値が低い場合に早期検出を可能にすること。
  • 実験的に、Murphy Samplingが実際の応用においてThompson SamplingおよびLower Confidence Boundポリシーを上回ることを示すこと。

提案手法

  • 最悪ケースの仮説(µ∗ < γ)に条件づけたThompson Samplingの変種として、Murphy Samplingを提案。真の最小値に応じて動的にサンプリング行動を適応させる。
  • 非漸近的下界を厳密に導出し、µ∗ < γとµ∗ > γの両ケースで根本的に異なる最適なサンプリング戦略が存在することを明らかにする。
  • 指数型分布族に対する新しい自己正規化された乖離不等式(定理7)を導入。これにより、より攻撃的で早期の停止ルールが可能になる。
  • 複数の腕の証拠を集約する停止ルールを設計。最小値が低い場合に早期終了をトリガーする。
  • 一般化されたLPSampleフレームワークを用いて最適なサンプリング割り当てを導出するが、強制的探索を回避することでそれらを改善する。
  • マルティングルールに基づく濃度不等式とLambert W関数を用いて、停止ルールにおけるしきい値関数のタイトな境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1逐次的最小平均テストにおける最適なサンプリング割り当て戦略は何か。また、µ∗ < γとµ∗ > γの両ケースでどのように異なるか。
  • RQ2強制的探索を用いずに、真の最小値が低い場合と高い場合の両方の状況で最適性を達成できる一様なサンプリングルールは存在するか。
  • RQ3指数型分布族に対して自己正規化された乖離不等式をどのように構築し、逐次的テストにおける早期停止を可能にできるか。
  • RQ4δ-correctな逐次的最小平均テストに必要な最小サンプル複雑度は何か。
  • RQ5Murphy Samplingは、サンプル効率および意思決定までの時間の観点で、Thompson SamplingおよびLower Confidence Boundポリシーと比較してどのように異なるか。

主な発見

  • Thompson SamplingやLower Confidence Boundポリシーとは異なり、Murphy Samplingはµ∗ < γおよびµ∗ > γの両方の状況で最適なサンプリング行動を達成する。
  • 提案された自己正規化された乖離不等式は、ガウス分布および非一様設定における既存の結果を一般化し、よりタイトで攻撃的な停止ルールを可能にする。
  • 集約停止ルールによりδ-correct性が保証され、最小値が低い場合に早期停止が可能となり、そのような状況での期待サンプルサイズが著しく削減される。
  • 理論的解析により、サンプル複雑度の下界が、漸近的最適性だけでなく中程度リスクの行動を反映していることが示された。
  • 実験的結果により、Murphy Samplingがサンプル効率および意思決定の迅速性の両面で、Thompson SamplingおよびLower Confidence Boundポリシーを一貫して上回ることが示された。
  • この手法は強制的探索を回避するため、品質管理、eラーニング、異常検知などの実世界の応用において、より実用的で効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。