Skip to main content
QUICK REVIEW

[论文解读] Meta-analysis of heterogeneous data: integrative sparse regression in high-dimensions

Subha Maity, Yuekai Sun|arXiv (Cornell University)|Dec 26, 2019
Statistical Methods and Inference被引用 5
一句话总结

该论文提出 MrLasso,一种用于异质数据集高维元分析的鲁棒整合稀疏回归方法。通过使用降权损失函数识别跨数据集的稀疏、可解释的全局参数,MrLasso 在罕见癌症类型上的预测性能优于基于均值的聚合或全局 Lasso,且收敛速度更快,同时通过单次估计器保护数据隐私。

ABSTRACT

We consider the task of meta-analysis in high-dimensional settings in which the data sources are similar but non-identical. To borrow strength across such heterogeneous datasets, we introduce a global parameter that emphasizes interpretability and statistical efficiency in the presence of heterogeneity. We also propose a one-shot estimator of the global parameter that preserves the anonymity of the data sources and converges at a rate that depends on the size of the combined dataset. For high-dimensional linear model settings, we demonstrate the superiority of our identification restrictions in adapting to a previously seen data distribution as well as predicting for a new/unseen data distribution. Finally, we demonstrate the benefits of our approach on a large-scale drug treatment dataset involving several different cancer cell-lines.

研究动机与目标

  • 解决因数据异质性导致全局参数欠定的可识别性问题。
  • 为全局参数开发一种统计高效且计算可扩展的估计器,利用跨数据集的联合样本量。
  • 通过鲁棒统计方法识别跨数据集的一致系数,确保全局参数保持稀疏且可解释。
  • 通过聚焦于跨数据源的一致共享效应,提升对罕见或未见数据分布的预测准确性。

提出的方法

  • 提出一种基于降权损失函数 Ψ 的全局参数 θ₀* 的新型识别约束,将其定义为对每个系数 j,所有 k 个数据集的 Ψ((θₖ*)ⱼ − μⱼ) 之和的最小化解。
  • 将 θ₀* 定义为跨数据集第 j 个系数的鲁棒位置估计(如截尾均值或 M-估计),确保其反映内点簇而非异常值。
  • 引入一种单次估计器,无需共享原始数据即可计算全局参数,保护数据源匿名性,并实现通信高效的分布式计算。
  • 对鲁棒聚合的系数应用软阈值化处理,以强制实现稀疏性,从而获得稀疏、可解释的全局模型。
  • 使用交叉验证选择集成估计器的正则化参数 η 和阈值水平 t。
  • 在元分析前对各独立数据集采用去偏 Lasso 方法,以提升整合前的估计精度。

实验结果

研究问题

  • RQ1对全局参数采用鲁棒识别约束,是否能提升高维异质数据元分析中的可解释性与统计效率?
  • RQ2与基于均值的聚合和全局 Lasso 相比,所提出的 MrLasso 估计器在罕见癌症类型上的预测性能如何?
  • RQ3使用降权损失函数是否能实现依赖于跨数据集总样本量的更快收敛速率?
  • RQ4MrLasso 在不过度聚合不一致效应大小的情况下,对不同数据源间异质性水平变化的适应能力如何?
  • RQ5单次估计器是否能在不共享原始数据的分布式非同质数据环境中,同时保持隐私性与统计效率?

主要发现

  • MrLasso 实现了依赖于所有数据集总样本量的更快全局参数收敛速率,提升了统计效率。
  • 与基于均值的聚合相比,MrLasso 估计的全局参数显著更稀疏,尤其在局部参数具有不相交支撑或效应大小差异较大时。
  • 在罕见癌症类型的预测任务中,MrLasso 一致优于基于均值的估计器和全局 Lasso,尤其在效应大小异质性较高时表现更优。
  • 在极端异质性情况下,MrLasso 自动避免聚合不一致的效应大小,防止了基于均值方法中常见的性能下降。
  • 单次估计器通过不传输原始数据保护了数据隐私,同时仍实现估计误差以依赖于联合样本量的速率趋于零。
  • 在 CCLE 药物反应数据集上的实证结果表明,由于聚焦于跨数据源的共享鲁棒信号,MrLasso 对未见癌症类型的泛化能力更强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。