[论文解读] Data fusion methods for the heterogeneity of treatment effect and confounding function
本文提出了一种半参数、速率双重稳健的估计量,通过整合随机试验和观察性研究数据,在存在隐藏混杂因素的情况下,提升对异质性处理效应推断的效率。通过将混杂函数作为共享参数,该方法非参数地识别处理效应异质性与混杂偏倚,在可运输性成立时,其效率高于仅使用试验数据的估计量。
The heterogeneity of treatment effect (HTE) lies at the heart of precision medicine. Randomized controlled trials are gold-standard for treatment effect estimation but are typically underpowered for heterogeneous effects. In contrast, large observational studies have high predictive power but are often confounded due to the lack of randomization of treatment. We show that an observational study, even subject to hidden confounding, may be used to empower trials in estimating the HTE using the notion of confounding function. The confounding function summarizes the impact of unmeasured confounders on the difference between the observed treatment effect and the causal treatment effect, given the observed covariates, which is unidentifiable based only on the observational study. Coupling the trial and observational study, we show that the HTE and confounding function are identifiable. We then derive the semiparametric efficient scores and the integrative estimators of the HTE and confounding function. We clarify the conditions under which the integrative estimator of the HTE is strictly more efficient than the trial estimator. Finally, we illustrate the integrative estimators via simulation and an application.
研究动机与目标
- 解决由于样本多样性有限而导致统计功效不足的随机试验中异质性处理效应估计的挑战。
- 克服大型观察性研究中因未测量混杂因素导致的混杂偏倚,避免因果推断偏差。
- 构建一个统一框架,利用两种数据源非参数地识别处理效应异质性与混杂函数。
- 在参数结构模型下,推导出一种半参数高效估计量,以提升相对于仅使用试验数据估计的效率。
- 明确数据整合相较于仅依赖随机试验数据能实现严格更高效率的条件。
提出的方法
- 将混杂函数引入为在可观测协变量条件下未测量混杂因素对潜在结果影响的汇总统计量。
- 利用可运输性假设将试验中的处理效应与观察性样本联系起来,从而实现对处理效应异质性与混杂函数的同时识别。
- 通过重新参数化与几何方法推导出半参数高效得分,同时考虑模型结构带来的识别约束。
- 提出一种速率双重稳健的整合估计量,即使在对干扰函数的估计满足较弱正则性条件时,仍能保持根N收敛。
- 采用过度识别检验评估联合估计框架中的模型拟合度并验证假设。
- 采用两阶段估计程序:首先利用观察性数据估计混杂函数,然后将结果与试验数据整合以估计处理效应异质性。
实验结果
研究问题
- RQ1在存在隐藏混杂因素的观察性研究中,是否能通过整合数据提升随机试验中异质性处理效应估计的精度?
- RQ2在何种条件下,整合估计量的效率严格高于仅使用试验数据的估计量?
- RQ3在参数结构模型下,如何利用试验与观察性数据非参数地识别混杂函数?
- RQ4联合估计处理效应异质性与混杂函数的半参数效率界限是什么?
- RQ5如何实现速率双重稳健估计,以确保在对干扰函数采用灵活建模时仍能保证有效推断?
主要发现
- 在可运输性假设下,当混杂函数以足够精度估计时,整合估计量的根N收敛速度严格快于仅使用试验数据的估计量。
- 模拟研究显示,当观察性数据中存在未测量混杂因素时,整合估计量的置信区间比仅使用试验数据和元分析估计量更窄。
- 在癌症治疗数据的应用中,由于样本量小,仅使用试验数据的估计量不显著,而整合估计量通过提升效率获得了更精确的估计。
- 观察性研究中混杂函数的模型参数在年龄、性别和组织学类型上显著不同于零,表明无未测量混杂因素的假设可能不成立。
- 过度识别检验未能拒绝原假设,表明联合估计模型在经验上是合理且设定正确的。
- 当其中一个干扰模型(如倾向得分或结果回归)被错误设定时,只要另一个模型设定正确,整合估计量仍能保持有效推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。