[论文解读] Generalizing trial findings using nested trial designs with sub-sampling of non-randomized individuals
本文提出了一种双重稳健估计量,用于在使用子抽样非随机化个体的嵌套试验设计中,将随机试验的因果推论推广到更广泛的目标人群。通过利用辅助协变量指导抽样,在子样本中收集额外的基线协变量,该方法在保持弱可忽略性假设下的有效推断的同时,提高了研究经济性,理论和模拟研究均支持其效率与稳健性。
To generalize inferences from a randomized trial to the target population of all trial-eligible individuals, investigators can use nested trial designs, where the randomized individuals are nested within a cohort of trial-eligible individuals, including those who are not offered or refuse randomization. In these designs, data on baseline covariates are collected from the entire cohort, and treatment and outcome data need only be collected from randomized individuals. In this paper, we describe nested trial designs that improve research economy by collecting additional baseline covariate data after sub-sampling non-randomized individuals (i.e., a two-stage design), using sampling probabilities that may depend on the initial set of baseline covariates available from all individuals in the cohort. We propose an estimator for the potential outcome mean in the target population of all trial-eligible individuals and show that our estimator is doubly robust, in the sense that it is consistent when either the model for the conditional outcome mean among randomized individuals or the model for the probability of trial participation is correctly specified. We assess the impact of sub-sampling on the asymptotic variance of our estimator and examine the estimator's finite-sample performance in a simulation study. We illustrate the methods using data from the Coronary Artery Surgery Study (CASS).
研究动机与目标
- 解决在非随机化个体的基线协变量不完整时,将随机试验结果推广到更广泛的目标人群(试验合格个体)的挑战。
- 通过基于初始基线协变量的抽样概率,对非随机化个体进行子抽样以收集额外协变量,从而提高研究经济性。
- 开发一种目标人群中潜在结果均值的估计量,该估计量具有双重稳健性,即只要潜在结果均值模型或参与概率模型之一正确指定,估计量即保持一致。
- 评估子抽样对潜在结果均值估计量渐近方差的影响,并在小样本下评估其性能。
提出的方法
- 研究采用两阶段嵌套试验设计,将基线协变量划分为易于获取的($X_1$)和成本较高的($X_2$)两部分。
- 利用可能依赖于$X_1$的抽样概率,对非随机化个体进行子抽样以收集$X_2$,从而实现成本高效的资料收集。
- 提出一种用于目标人群中潜在结果均值的双重稳健估计量,结合逆概率加权与结果回归模型。
- 估计量在给定基线协变量下,随机与非随机个体之间条件交换性的假设下推导得出,确保有效的因果推断。
- 推导渐近方差以评估子抽样带来的效率增益,并通过模拟研究评估其小样本性能。
- 使用冠状动脉旁路移植术研究(CASS)的数据进行说明,展示了该方法在真实医疗环境中的实际应用。
实验结果
研究问题
- RQ1当对所有非随机化个体收集昂贵协变量不可行时,如何高效地将随机试验的因果推论推广到更广泛的目标人群?
- RQ2基于初始基线协变量指导的非随机化个体子抽样,对潜在结果均值估计量的方差有何影响?
- RQ3所提出的估计量在何种条件下具有双重稳健性?其在小样本下的性能与替代估计量相比如何?
- RQ4当潜在结果模型或参与概率模型之一被错误指定时,该方法能否维持有效的推断?
- RQ5抽样概率的选择(依赖于$X_1$)在实践中如何影响估计量的精度?
主要发现
- 所提出的潜在结果均值估计量具有双重稳健性,当随机个体中条件潜在结果均值模型或参与试验概率模型之一被正确指定时,估计量保持一致。
- 基于初始基线协变量$X_1$对非随机化个体进行子抽样,相比全数据估计,可降低估计量的渐近方差,从而提高效率。
- 模拟结果表明,该估计量在各种抽样概率和数据生成机制下均保持低偏差与良好的覆盖区间,包括连续与二值辅助协变量。
- 估计量的小样本性能稳定且高效,标准误随队列规模增大和抽样概率提高而减小。
- 在CASS应用中,该方法展示了实际效用,当抽样概率足够高时,子抽样下的标准误估计值与全数据估计器结果非常接近。
- 当抽样概率由能预测是否需要额外$X_2$数据的辅助协变量($X_1$)指导时,估计量的方差最小化,凸显了有信息子抽样的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。