[论文解读] Accounting for hidden common causes when inferring cause and effect from observational data
本文提出使用L2正则化多重线性回归结合实现关系矩阵(RRM),以考虑全基因组关联研究(GWAS)中的隐藏共同原因(如家族亲缘关系)。通过利用RRM对遗传相似性进行建模,该方法能有效推断隐藏混杂因素,校准p值,并在未测量的群体结构导致关联偏差时实现准确的因果推断。
Identifying causal relationships from observation data is difficult, in large part, due to the presence of hidden common causes. In some cases, where just the right patterns of conditional independence and dependence lie in the data---for example, Y-structures---it is possible to identify cause and effect. In other cases, the analyst deliberately makes an uncertain assumption that hidden common causes are absent, and infers putative causal relationships to be tested in a randomized trial. Here, we consider a third approach, where there are sufficient clues in the data such that hidden common causes can be inferred.
研究动机与目标
- 解决在推断因果关系时,观察数据中隐藏共同原因(如群体结构或家族亲缘关系)带来的挑战。
- 开发一种即使存在诱导SNP与性状之间虚假关联的未测量混杂因素,也能实现GWAS中准确因果推断的方法。
- 证明在使用L2正则化回归与实现关系矩阵时,即使存在隐藏混杂因素,p值仍能保持校准。
- 表明该方法通过利用SNP之间的相关结构,有效推断隐藏共同原因,从而阻断因果图中的d-连接路径。
提出的方法
- 使用L2正则化多重线性回归,将表型建模为一个测试SNP和所有其他SNP(称为'相似SNP')的函数。
- 将表型的联合分布建模为线性混合模型:$\mathbf{y} \sim \mathcal{N}(\mathbf{1}\mu + \mathbf{x}^*\beta^*; \sigma_e^2\mathbf{I} + \sigma_g^2\mathbf{XX}^T)$,其中$\mathbf{XX}^T$为实现关系矩阵(RRM)。
- 对相似SNP的回归系数施加层次先验,假设$\beta_i \sim \mathcal{N}(0, \sigma_g^2)$,从而诱导收缩,并实现对变异分量$\sigma_g^2/\sigma_e^2$的估计。
- 通过限制最大似然法(REML)估计模型参数,其中比值$\sigma_g^2/\sigma_e^2$通过网格搜索确定。
- 使用F检验计算p值,检验$\beta^* = 0$,其中RRM通过SNP相似性捕捉隐藏混杂因素的影响。
- 在所有SNP上使用单一共享的$\sigma_g^2/\sigma_e^2$估计值,以提高计算效率而不损失准确性。
实验结果
研究问题
- RQ1当存在家族亲缘关系等隐藏共同原因时,p值是否仍能在GWAS中保持校准?
- RQ2从所有SNP中推导出的实现关系矩阵(RRM)在多大程度上能有效推断并阻断未测量隐藏混杂因素的影响?
- RQ3在存在隐藏混杂因素时,L2正则化回归与单变量回归相比表现如何?
- RQ4当隐藏共同原因对性状存在直接因果效应时(例如,不同群体间的环境差异),该方法是否仍具有鲁棒性?
主要发现
- 当隐藏变量与性状之间不存在直接路径时,L2正则化回归的p值在广泛的家族亲缘关系水平、致病SNP数量和效应强度下均保持良好校准。
- 当引入隐藏变量与性状之间的直接路径(例如,由于群体水平的环境效应)时,由于通过SNP相似性有效推断了隐藏混杂因素,p值仍保持校准。
- 即使仅使用致病SNP生成数据,由所有SNP构建的实现关系矩阵(RRM)也能近似真实潜在混杂结构。
- 该方法在450个具有不同参数的合成GWAS数据集中均实现了校准,包括50%至90%的家族亲缘关系、10至1000个致病SNP,以及0.1至0.6的遗传力值。
- 在所有SNP上使用单一共享的$\sigma_g^2/\sigma_e^2$估计值,以极低的计算成本维持了p值校准。
- 结果表明,该方法通过利用SNP之间的相关结构,有效推断隐藏共同原因,从而阻断d-连接路径,实现有效的因果推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。