[论文解读] Inferring Treatment Effects After Testing Instrument Strength in Linear Models
本文提出了一种选择性推断方法,以校正工具变量(IV)分析中因在治疗效应推断前对工具强度进行预检(使用F统计量)而导致的I类错误膨胀问题。通过将F检验建模为随机凸优化问题,并应用选择性推断技术,该方法提供了有效的条件与边际I类错误控制;重新分析表明,若采用朴素推断,教育对收入影响的显著性会被严重高估。
A common practice in IV studies is to check for instrument strength, i.e. its association to the treatment, with an F-test from regression. If the F-statistic is above some threshold, usually 10, the instrument is deemed to satisfy one of the three core IV assumptions and used to test for the treatment effect. However, in many cases, the inference on the treatment effect does not take into account the strength test done a priori. In this paper, we show that not accounting for this pretest can severely distort the distribution of the test statistic and propose a method to correct this distortion, producing valid inference. A key insight in our method is to frame the F-test as a randomized convex optimization problem and to leverage recent methods in selective inference. We prove that our method provides conditional and marginal Type I error control. We also extend our method to weak instrument settings. We conclude with a reanalysis of studies concerning the effect of education on earning where we show that not accounting for pre-testing can dramatically alter the original conclusion about education's effects.
研究动机与目标
- 解决在IV模型中,当治疗效应推断前对工具强度进行预检(使用F统计量)时,导致的I类错误膨胀和无效p值问题。
- 开发一种方法,考虑预检结果(例如,F统计量 > 10)的条件性,以生成有效的统计推断。
- 通过使用如CLR检验等稳健检验统计量,将该方法扩展至弱工具变量情形。
- 通过重新分析教育与收入关系的里程碑研究,展示忽略预检偏差的实际影响。
- 建立一个通用的选择性推断框架,适用于IV设定中在效应估计前执行诊断检查(如工具强度)的情形。
提出的方法
- 将工具强度的预检问题建模为随机凸优化问题,从而可应用选择性推断工具。
- 使用基于抽样的推断方法,计算在工具强度F检验通过(或未通过)阈值条件下的治疗效应检验统计量的条件零分布。
- 应用选择性推断技术,推导出在预检结果条件下有效的精确p值和置信区间。
- 通过条件化于F统计量未超过阈值(例如,C₀ = 10)的情形,将方法扩展至弱工具变量,使用如CLR检验等对弱工具变量稳健的检验统计量。
- 实施基于模拟的程序,生成考虑预检选择事件的条件置信区间与p值。
- 通过理论证明与实证验证,确保条件与边际I类错误控制。
实验结果
研究问题
- RQ1在IV模型中,对工具强度进行预检如何扭曲治疗效应检验统计量的分布?
- RQ2忽略预检对标准IV推断中I类错误率与置信区间覆盖概率有何影响?
- RQ3选择性推断技术能否被调整以校正由工具强度预检引入的条件性?
- RQ4在传统IV估计量存在偏误的弱工具变量情形下,所提出的方法表现如何?
- RQ5在现实应用中(如估计教育回报率),预检偏差在多大程度上改变了结论?
主要发现
- 忽略工具强度预检的朴素推断会导致I类错误膨胀,且置信区间覆盖概率低于名义水平,尤其当F统计量接近10的阈值时更为明显。
- 在对Card(1995)关于教育与收入研究的重新分析中,原始TSLS方法得到的p值为0.016,但当正确考虑预检后,p值上升至0.602,表明效应不再显著。
- 对于Angrist和Keueger(1991)研究中弱工具变量的情形(F统计量≈0.96),条件95%置信区间为[-∞, +∞],表明无法进行精确推断;而无条件区间为[0.0238, 0.2671],错误地暗示了精度。
- 所提出的方法即使在弱工具变量下,也能实现置信区间的名义覆盖,并有效控制条件与边际I类错误率。
- 即使在使用如CLR检验等对弱工具变量稳健的检验统计量时,该方法依然有效,而这些统计量在标准方法中通常对条件性不敏感。
- 模拟与实证结果表明,若不考虑预检,会导致IV研究中结论过度自信且具有误导性,尤其在劳动经济学应用中更为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。