[论文解读] Omitted variable bias of Lasso-based inference methods: A finite sample analysis
本文对基于Lasso的推断方法(如后双Lasso和去偏Lasso)进行了有限样本分析,表明即使在经典假设和大样本条件下,由于Lasso未能选择出相关控制变量,仍可能产生遗漏变量偏差(OVB)。其核心贡献是建立了一套非渐近理论,证明当非零系数与控制变量方差的乘积小于正则化阈值的一半时,OVB将变得显著,从而破坏渐近推断的有效性。
We study the finite sample behavior of Lasso-based inference methods such as post double Lasso and debiased Lasso. We show that these methods can exhibit substantial omitted variable biases (OVBs) due to Lasso not selecting relevant controls. This phenomenon can occur even when the coefficients are sparse and the sample size is large and larger than the number of controls. Therefore, relying on the existing asymptotic inference theory can be problematic in empirical applications. We compare the Lasso-based inference methods to modern high-dimensional OLS-based methods and provide practical guidance.
研究动机与目标
- 研究在高维控制设定下,后双Lasso和去偏Lasso的有限样本行为。
- 识别Lasso在何种条件下无法选择出相关控制变量,从而导致遗漏变量偏差(OVB)。
- 质疑在样本量和维度均适中的实证应用中,现有渐近推断理论的可靠性。
- 比较基于Lasso的方法与高维OLS方法在偏差和大小扭曲方面的表现。
- 为应用研究者提供实用指导,说明基于Lasso的推断在何时以及为何可能失效。
提出的方法
- 构建非渐近理论框架,分析高维设定下后双Lasso和去偏Lasso中的OVB。
- 采用双重选择程序:首先对结果变量Y与控制变量X进行Lasso回归,再对处理变量D与控制变量X进行Lasso回归,随后对所选控制变量的并集进行OLS回归。
- 推导出Lasso在两个步骤中均未能选择出相关控制变量(即“双重选择不足”)的条件,从而导致OVB。
- 运用高维随机矩阵理论和浓度不等式,对协方差矩阵和精度矩阵估计器的估计误差进行有界控制。
- 应用并集界和次高斯尾部不等式,控制Lasso解的次梯度条件中大偏离事件的概率。
- 证明当非零系数绝对值与控制变量方差的乘积小于正则化参数的一半时,OVB具有显著性。
实验结果
研究问题
- RQ1在何种有限样本条件下,基于Lasso的推断会因未能选择出相关控制变量而产生遗漏变量偏差?
- RQ2非零系数的大小与控制变量方差如何影响后双Lasso中双重选择不足的概率?
- RQ3在有限样本中,由于基于Lasso的方法存在OVB,现有渐近推断程序在多大程度上会失效?
- RQ4在偏差和大小扭曲方面,基于Lasso的推断方法与高维OLS方法相比如何?
- RQ5在经典设计假设(如正态误差、正交设计)下,双重选择不足的理论概率是多少?
主要发现
- 即使真实模型是稀疏且样本量较大的情况下,基于Lasso的推断方法在有限样本中仍可能遭受显著的遗漏变量偏差(OVB)。
- 当非零系数绝对值与控制变量方差的乘积小于或等于正则化参数的一半时,‘双重选择不足’——即在两个Lasso选择步骤中均遗漏了相关控制变量——可能以高概率发生。
- 双重选择不足的概率上界由一个随 exp(−b log p / k³) 衰减的项决定,表明即使在中等样本中也存在不可忽视的风险。
- 由于有限样本中的OVB可能导致假设检验中显著性水平的严重扭曲,渐近推断理论在实践中可能不准确。
- 理论结果表明,OVB具有非渐近性,即使在正态同方差误差和正交设计等有利条件下也可能持续存在。
- 在实证相关设定中,高维OLS方法被证明比基于Lasso的方法对遗漏变量偏差更具鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。