Skip to main content
QUICK REVIEW

[論文レビュー] Accurate Inference for Adaptive Linear Models

Yash Deshpande, Lester Mackey|arXiv (Cornell University)|Dec 18, 2017
Advanced Bandit Algorithms Research参考文献 49被引用数 5
ひとこと要約

本稿は、逐次的依存性を持つデータ収集に起因する適応的線形回帰推定量のバイアスを是正するための新規な $\boldsymbol{W}$-非相関化手法を提案する。推定量のバイアスを、データ収集ポリシーの粗い情報のみを用いて分散に変換することで、漸近的に正規分布に従う推論が可能となり、マルチアームバンディットや自己回帰的サンプリングの下でも、標準的OLSや集中不等式に基づく手法よりも、カバレッジと区間幅の両面で優れた性能を発揮する。

ABSTRACT

Estimators computed from adaptively collected data do not behave like their non-adaptive brethren. Rather, the sequential dependence of the collection policy can lead to severe distributional biases that persist even in the infinite data limit. We develop a general method -- $\mathbf{W}$-decorrelation -- for transforming the bias of adaptive linear regression estimators into variance. The method uses only coarse-grained information about the data collection policy and does not need access to propensity scores or exact knowledge of the policy. We bound the finite-sample bias and variance of the $\mathbf{W}$-estimator and develop asymptotically correct confidence intervals based on a novel martingale central limit theorem. We then demonstrate the empirical benefits of the generic $\mathbf{W}$-decorrelation procedure in two different adaptive data settings: the multi-armed bandit and the autoregressive time series.

研究の動機と目的

  • 適応的線形モデルにおけるバイアスの推論問題に取り組むこと。ここでデータ収集ポリシーが逐次的依存性を引き起こす。
  • データ収集ポリシーの詳細な知識を必要とせず、推定量のバイアスを分散に変換する汎用的手法を開発すること。
  • 新しいマルティングール中心極限定理を用いて、適応的サンプリング下でのパrameter推定量の漸近的正規性を確立すること。
  • マルチアームバンディットと自己回帰的時系列の2つの適応的設定において、本手法の実証的妥当性を検証すること。
  • 提案された $\boldsymbol{W}$-推定量が名目水準のカバレッジを達成し、集中不等式に基づく手法よりも区間が狭いことを示すこと。

提案手法

  • データ収集ポリシーから導かれる重み行列を用いて、元の推定量をバイアス成分と分散成分に分解する $\boldsymbol{W}$-非相関推定量を導入する。
  • モーメント安定性および弱い探索条件の下で、$\boldsymbol{W}$-推定量の漸近的正規性を正当化する新しいマルティングール中心極限定理を採用する。
  • プロポーションスコアや正確なポリシー動的特性へのアクセスを一切不要とし、粗いポリシー情報のみを用いるため、広範な適用可能性を有する。
  • バイアスと分散のトレードオフを制御するための調整パrameter $\boldsymbol{\nu}$ を導入し、有限サンプル性能に対する理論的バウンドを確立する。
  • 漸近的正規性に基づく信頼区間を導出し、弱い正則性条件のもとで正しいカバレッジを保証する。
  • マルチアームバンディットおよびAR(2)時系列設定におけるモンテカルロシミュレーションを通じて、OLSおよび集中不等式に基づく手法と比較して、カバレッジと区間幅の両面で手法の有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1データが適応的に収集される状況下でも、標準的推定量に著しい分布バイアスが生じる中で、線形モデルのパラメータに対する信頼区間を構築可能か?
  • RQ2ポリシーの詳細な知識を一切持たない状況下で、適応的線形回帰推定量のバイアスをどれほど分散に変換できるか?
  • RQ3$\boldsymbol{W}$-非相関化手法は、マルチアームバンディットや時系列のような設定において、漸近的正規性および正しい実証的カバレッジを達成するか?
  • RQ4$\boldsymbol{W}$-推定量の信頼区間は、標準的OLSおよび集中不等式に基づく手法のそれと比較して、区間幅とカバレッジの両面でどのように異なるか?
  • RQ5平均的探索が適用されるような弱い探索条件下でも、本手法は正確な推論を維持できるか?

主な発見

  • $\boldsymbol{W}$-非相関推定量は、マルチアームバンディットおよびAR(2)時系列設定の両方で、名目水準に非常に近い実証的カバレッジを達成する。これに対して標準的OLSは一貫してカバレッジが不足する。
  • マルチアームバンディット設定では、$\boldsymbol{W}$-推定量は標準的OLS区間よりも一貫して高いカバレッジを達成し、ガウス分布に基づく推論を歪める負のバイアスを回避する。
  • 集中不等式に基づくOLS区間はほぼ100%のカバレッジを達成するが、非常に保守的である。これに対して$\boldsymbol{W}$-非相関区間ははるかに狭く、特に中程度の信頼水準においてはより少ない保守性を示す。
  • AR(2)時系列設定では、$\boldsymbol{W}$-推定量の誤差分布はほぼ正規分布に近く、一方OLSの誤差分布は歪んでいる。これは、$\boldsymbol{W}$-推定量の優れた漸近的挙動を裏付ける。
  • UCB、ECB、トムソンサンプリングの各ポリシーにおいて、$\boldsymbol{W}$-非相関区間は集中不等式に基づく区間よりも一貫して狭く、カバレッジは同等または優れている。
  • 平均的探索が適用されるような弱い探索条件下でも、本手法はほぼ最適なバイアス・分散制御を達成し、そのロバストネスを裏付ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。