Skip to main content
QUICK REVIEW

[論文レビュー] Omitted variable bias of Lasso-based inference methods: A finite sample analysis

Kaspar Wüthrich, Ying Zhu|arXiv (Cornell University)|Mar 20, 2019
Statistical Methods and Inference参考文献 42被引用数 5
ひとこと要約

本稿は、ポストダブルラッソやデバイアスレスラッソのようなラッソベースの推論手法について、有限標本における分析を提供しており、古典的仮定のもとでも大標本においても、ラッソの有効な制御変数選択の失敗により、変数が省かれるバイアス(OVB)が生じ得ることを示している。主な貢献は、非漸近的理論の構築であり、非ゼロ係数の積と制御変数の分散の積が正則化しきい値の半分未塔である場合、OVBが顕著になることを示しており、漸近的推論の有効性を損なうものである。

ABSTRACT

We study the finite sample behavior of Lasso-based inference methods such as post double Lasso and debiased Lasso. We show that these methods can exhibit substantial omitted variable biases (OVBs) due to Lasso not selecting relevant controls. This phenomenon can occur even when the coefficients are sparse and the sample size is large and larger than the number of controls. Therefore, relying on the existing asymptotic inference theory can be problematic in empirical applications. We compare the Lasso-based inference methods to modern high-dimensional OLS-based methods and provide practical guidance.

研究の動機と目的

  • 高次元の制御設定下におけるポストダブルラッソおよびデバイアスレスラッソの有限標本的挙動を調査すること。
  • ラッソが関連する制御変数を正しく選択しない条件、ならびにそれによる変数が省かれるバイアス(OVB)が生じる条件を特定すること。
  • 標本サイズと次元数が中程度である実応用研究において、既存の漸近的推論理論の信頼性を疑問視すること。
  • バイアスおよびサイズの歪みという観点から、ラッソベースの手法と高次元OLSベースの代替手法を比較すること。
  • 応用研究者に対して、ラッソベースの推論がいつ、なぜ失敗するかについての実務的指針を提供すること。

提案手法

  • 高次元設定下におけるポストダブルラッソおよびデバイアスレスラッソにおけるOVBを分析する非漸近的理論的枠組みを構築すること。
  • 二重選択手順を用いる:目的変数Yを制御変数Xでラッソ回帰し、処置変数Dを制御変数Xでラッソ回帰した後、選択された変数の集合を用いてOLSを実行する。
  • 両ステップで関連する制御変数が見逃される、いわゆる「二重未選択」が発生する条件を導出する。これはOVBを引き起こす。
  • 高次元ランダム行列理論および集中不等式を用いて、共分散行列および精密行列推定量の推定誤差を制限する。
  • 和集合不等式およびサブガウス型尾部不等式を用いて、ラッソ解の部分勾配条件における大きな逸脱確率を制御する。
  • 非ゼロ係数の大きさと制御変数の分散の積が正則化パラメータの半分未塔である場合、OVBが非無視的になることを確立する。

実験結果

リサーチクエスチョン

  • RQ1有限標本において、関連する制御変数が正しく選択されないために、ラッソベースの推論が変数が省かれるバイアス(OVB)を被る条件は何か?
  • RQ2非ゼロ係数の大きさと制御変数の分散の大きさが、ポストダブルラッソにおける二重未選択の確率にどのように影響を与えるか?
  • RQ3ラッソベースの手法におけるOVBが有限標本で顕著になることで、既存の漸近的推論手順がどの程度破綻するのか?
  • RQ4バイアスおよびサイズの歪みという観点から、ラッソベースの推論手法と高次元OLSベースの代替手法は、どのように比較されるか?
  • RQ5古典的設計仮定(例:正規誤差、直交設計)のもとで、二重未選択の理論的確率は何か?

主な発見

  • 真のモデルがスパースで標本サイズが大きくても、有限標本においてラッソベースの推論手法は顕著な変数が省かれるバイアス(OVB)を被り得る。
  • 関連する制御変数が両ステップのラッソ選択で見逃される「二重未選択」は、非ゼロ係数の大きさと制御変数の分散の積が正則化パラメータの半分未塔である場合、高い確率で発生する。
  • 二重未選択の確率は、exp(−b log p / k³) のように減衰する項によって上界で抑えられ、中程度の標本でも非無視的リスクを有することが示唆される。
  • 有限標本におけるOVBが仮説検定における顕著なサイズの歪みを引き起こすため、実務では漸近的推論理論が不正確になる可能性がある。
  • 理論的結果により、OVBは漸近的でなく、正規同分散誤差や直交設計といった好都合な条件下でも持続することが示された。
  • 実務的状況において、高次元OLSベースの手法は、ラッソベースの手法よりも変数が省かれるバイアスに対してよりロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。