Skip to main content
QUICK REVIEW

[论文解读] Implicit Causal Models for Genome-wide Association Studies

Dustin Tran, David M. Blei|arXiv (Cornell University)|Oct 30, 2017
Genetic Associations and Epidemiology被引用 17
一句话总结

本文提出了隐式因果模型(ICMs),利用神经网络和隐式密度来捕捉全基因组关联研究(GWAS)中复杂的非线性遗传互作与混杂因素。通过在遗传变异间共享信息以建模潜在的群体结构,ICMs 实现了最先进的准确率,在多种模拟和真实 GWAS 配置下,识别因果 SNP 的准确率比现有方法高出 15–45.3%。

ABSTRACT

Progress in probabilistic generative models has accelerated, developing richer models with neural architectures, implicit densities, and with scalable algorithms for their Bayesian inference. However, there has been limited progress in models that capture causal relationships, for example, how individual genetic factors cause major human diseases. In this work, we focus on two challenges in particular: How do we build richer causal models, which can capture highly nonlinear relationships and interactions between multiple causes? How do we adjust for latent confounders, which are variables influencing both cause and effect and which prevent learning of causal relationships? To address these challenges, we synthesize ideas from causality and modern probabilistic modeling. For the first, we describe implicit causal models, a class of causal models that leverages neural architectures with an implicit density. For the second, we describe an implicit causal model that adjusts for confounders by sharing strength across examples. In experiments, we scale Bayesian inference on up to a billion genetic measurements. We achieve state of the art accuracy for identifying causal factors: we significantly outperform existing genetics methods by an absolute difference of 15-45.3%.

研究动机与目标

  • 开发更丰富的因果模型,以捕捉 GWAS 中高度非线性的关系和基因-基因互作。
  • 通过在合理的概率框架中跨遗传样本共享信息,系统性地处理潜在混杂因素(如群体结构和亲缘关系)。
  • 将隐式因果模型的贝叶斯推断扩展至大规模基因组数据集,包括高达十亿个测量值的数据。
  • 在模拟和真实世界 GWAS 数据中,验证模型对虚假关联的鲁棒性和准确性。
  • 通过将现有混杂因素校正方法嵌入灵活的、基于神经网络的因果建模框架中,实现对现有方法的推广。

提出的方法

  • 提出隐式因果模型(ICMs),一类使用神经网络参数化结构方程、并利用隐式密度来建模 SNP 与性状之间复杂非线性关系的因果模型。
  • 采用深度神经网络架构来建模 SNP 对性状的因果效应,其中 SNP 和性状分别使用独立网络,而混杂因素则通过共享的潜在空间进行建模。
  • 引入一种混杂因素调整机制,通过在潜在混杂变量上施加层次先验,实现跨遗传位点的信息共享,从而在高维设置下实现稳健估计。
  • 使用带归一化流的变分推断,将贝叶斯推断扩展至大规模 GWAS 数据,包括高达十亿个基因组测量值。
  • 推导出模型在温和正则性条件下一致估计因果效应的理论条件,为其作为合理因果模型的使用提供理论依据。
  • 采用灵活的无需显式密度评估的似然自由推断方法,利用隐式密度避免显式密度计算,从而实现对噪声和互作关系的复杂非参数建模。

实验结果

研究问题

  • RQ1隐式因果模型是否能比传统线性或多项式模型更有效地捕捉 GWAS 中 SNP 与性状之间的复杂非线性互作?
  • RQ2在现代概率框架中,如何以可扩展且系统性的方式建模并调整潜在混杂因素(如群体结构和亲缘关系)?
  • RQ3在高维混杂因素存在的情况下,通过在遗传变异间共享信息,是否能提升因果推断的鲁棒性和准确性?
  • RQ4隐式因果模型是否能在包括稀疏、空间和混合成员结构在内的多种群体结构中,实现识别真实因果 SNP 的最先进性能?
  • RQ5在真实世界数据中,隐式因果模型与现有 GWAS 方法相比表现如何,特别是在识别生物相关基因座方面?

主要发现

  • 隐式因果模型在识别因果 SNP 方面显著优于现有遗传学方法,在所有模拟配置中精度绝对提升达 15–45.3%。
  • 在最具挑战性的配置下——空间群体结构且祖先信号微弱(a=0.01)——ICM 的精度比第二好的方法高出 45.3%。
  • 在真实世界北芬兰出生队列数据中,ICM 识别出 15 个全基因组显著基因座,与 Song 等人(2015)使用的逻辑因子分析方法表现相当,且优于其他识别出 11–14 个基因座的方法。
  • 该模型成功缓解了由潜在群体结构引起的虚假关联,在复杂且非线性的混杂情景下仍能保持高精度。
  • 理论分析证实,该模型在温和正则性条件下能一致估计因果效应,为混杂因素调整提供了坚实的理论基础。
  • 通过使用带归一化流的变分推断,成功将贝叶斯推断扩展至包含高达十亿个基因组测量值的数据集,使该方法在大规模 GWAS 中具备实际应用可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。