[论文解读] Individual Data Protected Integrative Regression Analysis of High-Dimensional Heterogeneous Data
本文提出SHIR(数据屏蔽高维整合回归),一种在严格隐私约束下对高维异质数据进行整合回归分析的新方法。通过仅聚合来自分布式站点的汇总统计量,SHIR实现了与完整数据方法相当的估计效率,确保了变量选择的一致性,并在理论和模拟中均优于基于去偏的分布式方法。
Evidence-based decision making often relies on meta-analyzing multiple studies, which enables more precise estimation and investigation of generalizability. Integrative analysis of multiple heterogeneous studies is, however, highly challenging in the ultra high-dimensional setting. The challenge is even more pronounced when the individual-level data cannot be shared across studies, known as DataSHIELD contraint. Under sparse regression models that are assumed to be similar yet not identical across studies, we propose in this paper a novel integrative estimation procedure for data-Shielding High-dimensional Integrative Regression (SHIR). SHIR protects individual data through summary-statistics-based integrating procedure, accommodates between-study heterogeneity in both the covariate distribution and model parameters, and attains consistent variable selection. Theoretically, SHIR is statistically more efficient than the existing distributed approaches that integrate debiased LASSO estimators from the local sites. Furthermore, the estimation error incurred by aggregating derived data is negligible compared to the statistical minimax rate and SHIR is shown to be asymptotically equivalent in estimation to the ideal estimator obtained by sharing all data. The finite-sample performance of our method is studied and compared with existing approaches via extensive simulation settings. We further illustrate the utility of SHIR to derive phenotyping algorithms for coronary artery disease using electronic health records data from multiple chronic disease cohorts.
研究动机与目标
- 解决由于隐私约束无法共享个体水平数据时,整合多研究所产生的高维异质数据的挑战。
- 开发一种统计高效、通信轻量的方法,在保护数据隐私的同时实现准确的变量选择和回归估计。
- 克服现有分布式学习方法的局限性,这些方法未能考虑模型异质性,或因去偏程序导致效率损失。
- 建立理论保证,证明SHIR在渐近意义上等价于拥有完整数据访问权限的理想估计器。
- 在真实应用场景中展示该方法的实用性,例如使用多队列电子健康记录数据进行冠状动脉疾病表型分析。
提出的方法
- SHIR采用基于汇总统计量的整合框架,避免传输个体水平数据,符合DataSHIELD隐私约束。
- 该方法采用混合惩罚函数,以在不同研究之间鼓励系数支持和大小的一致性,利用高维回归中的共享结构。
- 它在每个站点的汇总统计量上构建联合优化问题,避免计算或传输个体水平精度矩阵或去偏估计器。
- 该算法在每个本地站点仅求解一次LASSO问题,最大限度减少通信和计算开销。
- 理论分析表明,聚合带来的估计误差与极小极大率相比可忽略不计,且估计器在渐近意义上等价于理想全数据估计器。
- 在标准正则性和稀疏性条件下建立了稀疏一致性,对最小信号强度的假设弱于本地估计所需条件。
实验结果
研究问题
- RQ1在不共享个体水平数据的前提下,能否在整合高维异质回归数据时实现与全数据分析相当的估计效率?
- RQ2在隐私约束下,如何有效建模并处理多个研究中协变量分布和回归系数的异质性?
- RQ3仅使用汇总统计量的方法是否在统计效率和变量选择一致性方面优于现有的基于去偏的分布式方法?
- RQ4能否建立所提出方法与使用全部个体水平数据的理想估计器之间的理论等价性?
- RQ5在超高维设定下,该方法在何种条件下能确保一致的变量选择(稀疏一致性)?
主要发现
- SHIR的估计误差与极小极大率相比可忽略不计,表明在DataSHIELD约束下具有很高的统计效率。
- SHIR估计器在渐近意义上等价于通过完整数据访问获得的理想估计器,意味着其达到了最优收敛速率。
- 在模拟和真实数据中,SHIR均优于现有的基于去偏的分布式方法,尤其在信息矩阵密集时表现更优。
- 在标准条件下,该方法确保了稀疏一致性,且对最小信号强度的假设弱于本地估计所需条件。
- 该方法仅需一轮通信,并在每个站点求解一次LASSO,因此在计算和通信方面均高效。
- 在使用多队列电子健康记录数据进行冠状动脉疾病表型分析的应用中,SHIR成功构建了高精度且符合隐私要求的稳健预测模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。