Skip to main content
QUICK REVIEW

[论文解读] A Tree-based Model Averaging Approach for Personalized Treatment Effect Estimation from Heterogeneous Data Sources

Xiaoqing Tan, Chung‐Chou H. Chang|PubMed|Mar 10, 2021
Advanced Causal Inference Techniques参考文献 41被引用 9
一句话总结

该论文提出了一种基于树的模型平均框架,在分布式、隐私受限的环境中,通过自适应地结合来自多个异构站点的因果模型,而无需共享个体层面的数据,从而提升了个性化治疗效应估计的性能。通过使用考虑局部与全局异质性的、数据自适应的可解释树基权重,该方法实现了稳健且精确的条件平均治疗效应(CATE)估计,并通过真实世界ICU数据和全面的模拟实验得到验证,其性能优于基线方法。

ABSTRACT

Accurately estimating personalized treatment effects within a study site (e.g., a hospital) has been challenging due to limited sample size. Furthermore, privacy considerations and lack of resources prevent a site from leveraging subject-level data from other sites. We propose a tree-based model averaging approach to improve the estimation accuracy of conditional average treatment effects (CATE) at a target site by leveraging models derived from other potentially heterogeneous sites, without them sharing subject-level data. To our best knowledge, there is no established model averaging approach for distributed data with a focus on improving the estimation of treatment effects. Specifically, under distributed data networks, our framework provides an interpretable tree-based ensemble of CATE estimators that joins models across study sites, while actively modeling the heterogeneity in data sources through site partitioning. The performance of this approach is demonstrated by a real-world study of the causal effects of oxygen therapy on hospital survival rate and backed up by comprehensive simulation results.

研究动机与目标

  • 解决由于样本量有限导致单个研究站点在估计条件平均治疗效应(CATE)时统计效能不足的问题。
  • 在不共享敏感个体层面数据的前提下,实现跨多个站点的协作因果推断,尊重隐私和数据治理约束。
  • 对局部异质性(站点内治疗效应的变异)和全局异质性(由于站点层面混杂导致的跨站点变异)进行建模并加以考虑。
  • 开发一种可解释的、数据自适应的模型平均框架,通过整合来自多个站点的异构模型,提升CATE估计的准确性。
  • 为现实世界研究网络中的分布式因果推断提供一种实用、可扩展且易于实现的解决方案。

提出的方法

  • 该方法采用两级基于树的划分策略:一级用于站点层面的异质性,另一级用于个体层面的协变量,从而实现对来自不同站点模型的数据自适应加权。
  • 采用灵活的树基加权方案,将更高的影响力赋予那些患者特征与目标站点最相似的站点的模型,从而提升因果估计的可迁移性。
  • 通过将模型平均与因果推断相结合,整合来自多个站点的CATE估计器,其中权重通过递归划分学习,以反映治疗效应模式的相似性。
  • 通过站点层面混杂显式建模全局异质性,并允许在站点间存在异质性治疗效应,即使在可迁移性假设不成立的情况下亦成立。
  • 支持观察性与实验性设计,并在模拟研究中显示对倾向得分模型误设具有鲁棒性。
  • 该方法通过集成技术(如ET(集成树)和EF(集成森林))实现,能够根据患者和站点特征动态调整模型贡献。

实验结果

研究问题

  • RQ1在不共享个体层面数据的前提下,跨多个异构研究站点的模型平均能否提升目标站点的条件平均治疗效应(CATE)估计准确性?
  • RQ2模型平均框架如何有效应对分布式数据源中治疗效应的局部与全局异质性?
  • RQ3数据自适应、可解释的树基权重在多大程度上能增强在患者人群和临床实践不同的站点之间CATE估计的可迁移性?
  • RQ4在模型误设及现实世界与模拟环境中不同程度的全局异质性下,所提出方法的表现如何?
  • RQ5该框架能否作为大规模研究网络中协作因果推断的实用、隐私保护解决方案?

主要发现

  • 所提出的ET与EF方法在与标准模型平均和集成方法的比较中表现出具有竞争力的性能,且对站点间不同水平的全局异质性具有鲁棒性。
  • 在模拟实验中,ET-oracle与EF-oracle估计器实现了接近零的均方误差(MSE)比率,且方差极小,表明在已知真实治疗效应时具有极高准确性。
  • 在eICU数据库中对氧疗对住院生存率影响的真实世界应用中,该方法表现出优越性能,其中EF模型在预期生存率方面实现了最大提升。
  • EF模型估计的治疗效应显示,BMI约为35且治疗时长超过400小时的患者从氧疗中获益最多。
  • EF模型中的数据自适应权重表明,床位容量更大的医院贡献更大,暗示其在患者特征和结果方面与目标站点更为相似。
  • 当存在极端异质性时,该框架能有效识别何时应避免从其他站点借用信息,将权重用作诊断工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。