Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Inference Without Trading-off Regret in Bandits: An Allocation Probability Test for Thompson Sampling

Nina Deliu, Joseph Jay Williams|arXiv (Cornell University)|Oct 29, 2021
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿では、レギュレートを最小化するバンディットアルゴリズム(例:トムソンサンプリング)のデータに対して有効な推論を可能にする、新しい仮説検定法「割当確率検定(AP-test)」を提案する。この手法は、トムソンサンプリングの割当確率を用いることで、レギュレート性能を損なわずに妥当な推論を実現する。本手法は小標本でも高い統計的検出力を持つとともに、タイプI誤りを制御し、バンディットの探索的行動を制限する必要がなく、大標本を要しない。

ABSTRACT

Using bandit algorithms to conduct adaptive randomised experiments can minimise regret, but it poses major challenges for statistical inference (e.g., biased estimators, inflated type-I error and reduced power). Recent attempts to address these challenges typically impose restrictions on the exploitative nature of the bandit algorithm$-$trading off regret$-$and require large sample sizes to ensure asymptotic guarantees. However, large experiments generally follow a successful pilot study, which is tightly constrained in its size or duration. Increasing power in such small pilot experiments, without limiting the adaptive nature of the algorithm, can allow promising interventions to reach a larger experimental phase. In this work we introduce a novel hypothesis test, uniquely based on the allocation probabilities of the bandit algorithm, and without constraining its exploitative nature or requiring a minimum experimental size. We characterise our $Allocation\\ Probability\\ Test$ when applied to $Thompson\\ Sampling$, presenting its asymptotic theoretical properties, and illustrating its finite-sample performances compared to state-of-the-art approaches. We demonstrate the regret and inferential advantages of our approach, particularly in small samples, in both extensive simulations and in a real-world experiment on mental health aspects.

研究の動機と目的

  • レギュレートを最小化するバンディットアルゴリズム(例:トムソンサンプリング)を用いて収集されたデータに対して、妥当な統計的推論を実施する課題に対処すること。
  • 既存手法の限界を克服すること。具体的には、バンディットの探索的行動を制限することでレギュレートを増加させるか、漸近的有効性を確保するために大標本を必要とする手法のいずれかである。
  • 小標本のパイロット研究においても高い統計的検出力を維持しつつ、タイプI誤りを制御できる仮説検定を開発すること。
  • 臨床試験やモバイルヘルス分野など、小規模で適応的な実験が一般的な分野における実務研究者に実用的で、漸近的でないソリューションを提供すること。

提案手法

  • AP-testは、等確率ランダム化の閾値(π^ER = 1/(K+1))を反映する、実験的アームの割当確率がそれを上回る時間の割合に基づく。
  • 検定統計量は、推定された実験アームへの割当確率がπ^ERを超える時間ステップTの数として定義される。
  • 各時間ステップにおける割当確率を推定するために、モンテカルロシミュレーションが用いられ、計算の実行可能性が保証される。
  • 帰無仮説の下での検定統計量の正確な分布を用いて臨界値を計算し、タイプI誤りを制御する。漸近的正規性に依存しない。
  • 理論的保証は収束結果を用いて確立される:帰無仮説の下では、検定統計量は確率的に有界のまま保たれる。対立仮説の下では、Tが増加するにつれて無限大に発散する。
  • 本手法は、元の報酬分布に依存せず、バッチ化または層別化されたデータ構造を必要としない。

実験結果

リサーチクエスチョン

  • RQ1バンディットの探索的行動を制限せずに、小標本のバンディット実験において妥当なタイプI誤り制御を実現できる仮説検定を構築できるか?
  • RQ2AP-testは、BOLS や AW-AIPW といった既存手法と比較して、小標本においてより高い統計的検出力を達成するか?
  • RQ3トムソンサンプリング下での実験アームの割当確率はどのように変化するか?この挙動を推論に活用できるか?
  • RQ4標準的なトムソンサンプリング下でAP-testは漸近的に有効であるか?また、実験アームが優れている場合に、帰無仮説を棄却に導く収束を示すか?

主な発見

  • AP-testは、小標本においてタイプI誤りを適切に制御する。これに対して、AW-AIPWは標本サイズが小さいとタイプI誤りが膨張する。
  • AP-testは、小さなバッチサイズでも高い統計的検出力を維持する。これに対して、BOLSはバッチサイズ3では検出力が0.1未満にとどまる。
  • 対立仮説の下で、AP-testの検定統計量はTが増加するにつれて無限大に発散する。これは、一貫性の確認である。
  • 時間の経過とともに、トムソンサンプリング下での最適アームの割当確率はほとんど確実に1に収束する。これは、本手法の理論的基盤を支持する。
  • 本手法は、バンディットのレギュレート性能を制限せずに妥当な推論を可能にし、最良のアームの完全な利用を可能にする。
  • シミュレーションおよび実世界のメンタルヘルス実験からの実証的結果は、AP-testが最先端の代替手法に比べて小標本設定において優れていることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。