Skip to main content
QUICK REVIEW

[論文レビュー] Inference for Batched Bandits

Kelly Zhang, Lucas Janson|PubMed|Feb 8, 2020
Advanced Bandit Algorithms Research参考文献 44被引用数 19
ひとこと要約

この論文は、適応的・従属的なサンプリングに起因して標準的OLSが失敗する、バッチ化されたバンディットアルゴリズムによって収集されたデータにおける有効な統計的推論を可能にするため、バッチ化OLS(BOLS)推定量を導入する。標準的OLSは、腕の間隔がゼロの場合に漸近的に正規分布でなくなることが示され、これにより標準的推論が無効になる。BOLSは漸近的正規性を回復し、非定常性に対してもロバストであるため、治療効果差の信頼区間を信頼性を持って構築できる。

ABSTRACT

As bandit algorithms are increasingly utilized in scientific studies and industrial applications, there is an associated increasing need for reliable inference methods based on the resulting adaptively-collected data. In this work, we develop methods for inference on data collected in batches using a bandit algorithm. We first prove that the ordinary least squares estimator (OLS), which is asymptotically normal on independently sampled data, is <i>not</i> asymptotically normal on data collected using standard bandit algorithms when there is no unique optimal arm. This asymptotic non-normality result implies that the naive assumption that the OLS estimator is approximately normal can lead to Type-1 error inflation and confidence intervals with below-nominal coverage probabilities. Second, we introduce the Batched OLS estimator (BOLS) that we prove is (1) asymptotically normal on data collected from both multi-arm and contextual bandits and (2) robust to non-stationarity in the baseline reward.

研究の動機と目的

  • オンライン教育やモバイルヘルスなどの実世界の応用分野において、バンディットアルゴリズムを用いて収集されたデータに対する信頼性のある統計的推論手法の不足に対処すること。
  • 真の腕の間隔がゼロの場合に通常最小二乗法(OLS)推定量が漸近的に正規分布でなくなるという根本的問題を特定・解消すること。
  • 多腕バンディットおよび文脈付きバンディットの両方において、非定常報酬に対しても漸近的正規性を保証する新しい推定量「バッチ化OLS(BOLS)」を開発すること。
  • 腕の平均が時間とともに変化するような時間的非定常性がある状況でも、定常性仮定を必要とせずに推論が有効であることを保証すること。
  • 科学的発見や一般化可能な結論を得るために、バンディットによって収集されたデータに対して信頼性のある信頼区間を構築する実用的で漸近的に有効な手法を提供すること。

提案手法

  • 適応的バンディットサンプリングが引き起こす依存性を是正するため、OLSの修正版としてバッチ化OLS(BOLS)推定量を提案する。
  • 設計行列と誤差項の相関を解消するために、時間に応じて減衰する重み行列を用いたW-非相関推定量フレームワークを導入する。
  • 最適な重み行列Wを再帰的更新ルールにより導出する:$\textbf{W}_{i} = (\underline{\textbf{I}}_{p} - \underline{\textbf{W}}_{i-1}\underline{\textbf{X}}_{i-1}) \frac{\textbf{X}_{i}}{\lambda + \|\textbf{X}_{i}\|^{2}_{2}}$。これにより相関の解消が保証される。
  • 時間割引を適用するため$\lambda \geq 1$と設定することで、後続の観測を軽減し、初期の観測を強調し、非定常性下での推定量の安定性を向上させる。
  • 多腕バンディットおよび文脈付きバンディットの両方において、腕の間隔がゼロであっても、BOLSが漸近的に正規分布に従うことを証明する。
  • 2腕バンディットの場合のW-非相関推定量が、$r(1-r)^{N_{1,i-1}}$ を介して後続の観測を明示的に軽減することを示す。ここで $r = 1/(\lambda+1)$。

実験結果

リサーチクエスチョン

  • RQ12つのバンディット腕の間隔がゼロの場合、なぜ通常最小二乗法(OLS)推定量が漸近的に正規分布でなくなるのか?
  • RQ2最適な腕が一意でない場合でも、適応的・バッチ化バンディットサンプリング下で漸近的正規性を保つように修正されたOLS推定量を構築できるか?
  • RQ3バンディット実験における報酬の非定常性に対して、統計的推論をどのようにしてロバストに保つか?
  • RQ4BOLS推定量において、サンプリングの依存性を是正するために時間に応じて減衰する重み付けスキームを用いる理論的根拠は何か?
  • RQ5真の間隔がゼロであっても、BOLS推定量は治療効果の信頼区間に対して有効なカバレッジを維持するか?

主な発見

  • バンディットアルゴリズムにおいて、腕の選択確率が集中しないため、真の腕の間隔がゼロの場合にOLS推定量は漸近的に正規分布でなくなる。
  • 腕の間隔がゼロでない場合、OLSは漸近的に正規分布に従うが、一様収束性の欠如により、正規近似やブートストラップなどの標準的推論手法が無効になる。
  • バッチ化OLS(BOLS)推定量は、最適な腕が一意でない場合でも、多腕バンディットおよび文脈付きバンディットの両方において、漸近的に正規分布に従うことが証明された。
  • BOLSは、腕の平均が時間とともに変化する非定常報酬プロセスに対しても有効であり、定常性仮定を必要としない。
  • W-非相関推定量は、時間に応じて減衰する重みを適用することで相関を解消し、i番目の観測の重みは $r(1-r)^{N_{1,i-1}}$ に比例する。ここで $r = 1/(\lambda+1)$。
  • BOLS推定量は、非i.i.d.かつ非定常な状況下でも、名目水準に近いカバレッジ確率を持つ信頼性の高い信頼区間を構築可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。