[论文解读] Data-adaptive doubly robust instrumental variable methods for treatment effect heterogeneity
本文提出了针对随机试验中非依从性问题的数据自适应双重稳健工具变量估计方法——具体为局部高效g-估计量和目标最大似然估计量(TMLE)——用于估计治疗效应异质性。通过利用Super Learner集成机器学习方法估计干扰参数,该方法在模型误设情况下相比传统的两阶段最小二乘法(TSLS)或参数型双重稳健估计量,表现出更低的偏差和更优的覆盖率。
We consider the estimation of the average treatment effect in the treated as a function of baseline covariates, where there is a valid (conditional) instrument. We describe two doubly robust (DR) estimators: a locally efficient g-estimator, and a targeted minimum loss-based estimator (TMLE). These two DR estimators can be viewed as generalisations of the two-stage least squares (TSLS) method to semi-parametric models that make weaker assumptions. We exploit recent theoretical results that extend to the g-estimator the use of data-adaptive fits for the nuisance parameters. A simulation study is used to compare standard TSLS with the two DR estimators' finite-sample performance, (1) when fitted using parametric nuisance models, and (2) using data-adaptive nuisance fits, obtained from the Super Learner, an ensemble machine learning method. Data-adaptive DR estimators have lower bias and improved coverage, when compared to incorrectly specified parametric DR estimators and TSLS. When the parametric model for the treatment effect curve is correctly specified, the g-estimator outperforms all others, but when this model is misspecified, TMLE performs best, while TSLS can result in large biases and zero coverage. Finally, we illustrate the methods by reanalysing the COPERS (COping with persistent Pain, Effectiveness Research in Self-management) trial to make inference about the causal effect of treatment actually received, and the extent to which this is modified by depression at baseline.
研究动机与目标
- 解决随机试验中因非依从而导致实际接受治疗与分配治疗不同的因果推断问题。
- 在考虑治疗效应异质性的情况下,估计基线协变量函数下的治疗组平均治疗效应。
- 通过在工具变量模型中采用数据自适应方法估计干扰参数,提升估计效率与稳健性。
- 评估在参数模型与机器学习模型下拟合双重稳健估计量时的有限样本性能。
- 在真实世界试验(COPERS)中应用并说明该方法,以评估基线抑郁水平对疼痛自我管理干预措施因果效应的调节作用。
提出的方法
- 提出两种双重稳健(DR)估计量:针对有效工具下治疗组平均治疗效应的局部高效g-估计量和目标最大似然估计量(TMLE)。
- 通过在基线协变量条件下建模结果和暴露变量,将双重稳健性质扩展至治疗效应异质性的情境。
- 采用基于Super Learner集成机器学习方法的数据自适应估计来估计干扰参数(如结果回归、倾向得分、工具变量模型)。
- 利用正交性和影响函数为基础的估计方法,确保即使在机器学习估计器收敛缓慢时,仍能保持渐近正态性和有效推断。
- 采用基于目标损失最小化的TMLE方法,并结合交叉验证,以在有限样本中提升效率并减少偏差。
- 推导出数据自适应g-估计量渐近线性且根n一致性的正则性条件,依赖于干扰估计器的收敛速率。
实验结果
研究问题
- RQ1在模型误设情况下,数据自适应双重稳健估计量与标准两阶段最小二乘法(TSLS)在偏差与覆盖率方面有何比较?
- RQ2当干扰参数通过参数模型与机器学习方法(如Super Learner)估计时,双重稳健估计量的有限样本性能如何?
- RQ3当治疗效应模型正确设定或误设时,估计量选择(g-估计量 vs. TMLE)是否具有显著影响?
- RQ4当结果模型与暴露模型均被误设时,数据自适应DR估计量是否仍能保持低偏差与良好覆盖率?
- RQ5在COPERS试验中,基线抑郁程度在多大程度上调节了实际接受治疗的因果效应?
主要发现
- 使用Super Learner估计干扰参数的数据自适应双重稳健估计量,相比参数型双重稳健估计量和TSLS,表现出显著更低的偏差与更优的覆盖率。
- 当治疗效应模型正确设定时,g-估计量在偏差与均方误差方面优于所有其他方法。
- 当治疗效应模型误设时,基于TMLE的估计量表现最佳,而TSLS在某些情景下产生极大偏差与零覆盖率。
- 在高样本量情景($n=10,000$)下,当结果与暴露模型均被误设时,TSLS的覆盖率仅为0.000,表明严重推断失败。
- 在相同高样本量、模型误设的情景下,基于TMLE的估计量实现了100%的覆盖率,证明其在模型误设下的稳健性。
- 在COPERS试验的再分析中,发现实际接受治疗对疼痛相关残疾的因果效应受到基线抑郁程度的调节,且数据自适应DR方法提供了可靠的推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。