[论文解读] Combining Observational and Experimental Data to Improve Efficiency Using Imperfect Instruments
本文提出一种方法,通过使用不完美的工具变量(即与处理分配相关但可能违反排除限制的预处理协变量)来结合实验数据与观测数据。通过校正观测估计中的偏差,并利用广义矩法(GMM)或加权方法将观测估计与实验估计结合,该方法可将方差减少高达50%,从而在实验样本量减半的情况下实现同等精度。
Randomized controlled trials generate experimental variation that can credibly identify causal effects, but often suffer from limited scale, while observational datasets are large, but often violate desired identification assumptions. To improve estimation efficiency, I propose a method that leverages imperfect instruments - pretreatment covariates that satisfy the relevance condition but may violate the exclusion restriction. I show that these imperfect instruments can be used to derive moment restrictions that, in combination with the experimental data, improve estimation efficiency. I outline estimators for implementing this strategy, and show that my methods can reduce variance by up to 50%; therefore, only half of the experimental sample is required to attain the same statistical precision. I apply my method to a search listing dataset from Expedia that studies the causal effect of search rankings on clicks, and show that the method can substantially improve the precision.
研究动机与目标
- 解决数字营销中实验规模受限的问题,即随机化试验常因样本量过小而缺乏精度。
- 克服由于内生性导致的观测数据偏差,即预处理协变量同时与处理和结果相关。
- 开发一种方法,利用大规模观测数据和不完美的工具变量,在不引入显著偏差的前提下提升估计效率。
- 证明偏差校正后的观测估计与仅基于实验的估计不相关,从而可通过GMM或加权方法高效结合。
- 为使用算法系统(如搜索排名、定价)的企业提供一个实用框架,将真实世界数据与小规模实验结合,实现更精确的因果推断。
提出的方法
- 在实验和观测数据集中,将预处理协变量(Z)用作不完美工具变量——满足相关性但可能违反排除限制。
- 利用实验数据作为基准,估计偏差校正后的观测模型,以校正观测样本中的内生性问题。
- 基于校正后的观测估计推导矩条件,并通过广义方法矩(GMM)将这些条件与实验数据结合。
- 应用加权或GMM方法,将仅基于实验的估计量与偏差校正后的观测估计量结合,利用二者不相关性以降低方差。
- 正式证明:在观测样本量较大且预处理协变量对处理分配具有强预测能力的条件下,方差减少可达50%。
- 使用两个数据集实施该方法:一个包含随机处理(实验数据),另一个包含算法分配的处理(观测数据),两者均包含结果、处理和协变量。
实验结果
研究问题
- RQ1是否可以使用不完美的工具变量(即与处理相关但违反排除限制的协变量)来结合实验数据,从而提升估计效率?
- RQ2如何利用实验数据校正由于工具变量无效导致的观测估计偏差?
- RQ3与仅使用实验数据相比,结合实验与观测估计能在多大程度上减少方差?
- RQ4在何种条件下(如样本量、工具变量强度)能最大化结合这些数据源带来的效率增益?
- RQ5在现实世界数字营销应用中(如估计搜索排名对用户点击的影响),该方法表现如何?
主要发现
- 当观测数据量大且预处理协变量对处理分配具有强预测能力时,所提方法可将估计方差减少高达50%。
- 在模拟中,组合的GMM估计量实现了45.7%的效率增益,将均方误差(MSE)降低至仅使用实验数据的基准估计量的54.3%。
- 在模拟中,组合的GMM方法显著提升了检测利率对贷款需求负向影响的统计功效,使在95%显著性水平下的检测率从13.99%提高至21.18%。
- 偏差校正后的观测估计与仅基于实验的估计不相关,从而可高效结合且不引入偏差。
- 在Expedia搜索排名数据的应用中,该方法显著提高了对排名因果效应与点击率关系估计的精度。
- 该方法在算法驱动环境中尤为有效,其中预处理协变量(如酒店评分、需求预测)自然充当了不完美的工具变量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。