[论文解读] Estimating and accounting for unobserved covariates in high dimensional correlated data
本论文提出了CBCV和CorrConf,这两种计算效率高的方法用于估计高维相关数据(如纵向或多重组织'组学'数据)中潜在混淆因子的数量与结构,此类数据因残差非独立同分布而使标准方法失效。所提方法可实现潜在因子的可证明准确估计与校正,从而提升对已知协变量的后续推断性能。
Many high dimensional and high-throughput biological datasets have complex sample correlation structures, which include longitudinal and multiple tissue data, as well as data with multiple treatment conditions or related individuals. These data, as well as nearly all high-throughput `omic' data, are influenced by technical and biological factors unknown to the researcher, which, if unaccounted for, can severely obfuscate estimation and inference on effects due to the known covariate of interest. We therefore developed CBCV and CorrConf: provably accurate and computationally efficient methods to choose the number of and estimate latent confounding factors present in high dimensional data with correlated or nonexchangeable residuals. We demonstrate each method's superior performance compared to other state of the art methods by analyzing simulated multi-tissue gene expression data and identifying sex-associated DNA methylation sites in a real, longitudinal twin study. As far as we are aware, these are the first methods to estimate the number of and correct for latent confounding factors in data with correlated or nonexchangeable residuals. An R-package is available for download at https://github.com/chrismckennan/CorrConf.
研究动机与目标
- 解决在具有复杂相关结构的高维生物数据(如纵向、多组织或相关个体研究)中未观测混淆因子的挑战。
- 开发一种方法,可在残差相关或不可交换的场景下准确估计潜在混淆因子的数量与结构,此类情况是现有方法失效的场景。
- 通过校正潜在因子而不假设残差独立同分布,实现对感兴趣已知协变量的准确后续推断。
- 为具有异质残差方差与结构化相关性的数据(如重复测量或批次效应导致的数据)提供可证明准确且计算高效的解决方案。
提出的方法
- 提出CBCV(基于交叉验证的准则)与CorrConf(相关性-混淆)作为新颖方法,联合估计高维数据中具有相关残差的潜在因子数量及其结构。
- 采用基于似然的框架,通过包含组特异性与时间特异性成分的结构化方差-协方差矩阵,考虑非独立同分布的残差结构。
- 采用两阶段估计:首先通过敏感于相关结构的惩罚似然准则估计潜在因子数量,然后使用校正的广义最小二乘法估计因子载荷。
- 采用基于投影的估计器,以解耦可观测与未观测协变量的影响,确保在潜在因子未被观测时,对感兴趣系数的估计仍具一致性。
- 在样本量与维度同时趋于无穷的双重渐近框架下,推导出估计系数的渐近正态性,建立理论有效性。
- 对潜在因子空间采用旋转不变估计器,并对残差方差估计器应用收缩校正,以避免在高维设定下过拟合。
实验结果
研究问题
- RQ1如何在具有相关或不可交换残差的高维数据中准确估计潜在混淆因子的数量?
- RQ2忽略残差相关性对标准潜在因子估计方法有何影响,这种影响如何作用于对已知协变量的后续推断?
- RQ3能否开发一种方法,联合估计具有复杂相关结构(如纵向或多重组织数据)数据中潜在因子的数量与结构?
- RQ4校正潜在因子在多大程度上能提升高通量'组学'数据中检测真实生物学效应的统计功效与准确性?
主要发现
- 在模拟的多组织基因表达数据中,CBCV与CorrConf在估计潜在因子数量及校正混淆方面优于现有最先进方法。
- 在包含8×10⁵个CpG位点的真实纵向双生子研究中,该方法成功识别出与性别相关的DNA甲基化位点,准确率高于竞争方法。
- 该方法是首个在具有相关或不可交换残差的数据中提供潜在因子可证明准确估计的方法,填补了当前统计方法中的关键空白。
- 理论分析表明,对感兴趣系数的估计量渐近服从正态分布,其方差-协方差结构已考虑未观测混淆,确保推断的有效性。
- 该方法避免了标准方法(如平行分析与双交叉验证)在相关数据中常出现的潜在因子数量过度估计问题。
- 一个名为CorrConf的R包已在https://github.com/chrismckennan/CorrConf公开发布,支持广泛复现与在真实研究中的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。