Skip to main content
QUICK REVIEW

[论文解读] netgwas: An R Package for Network-Based Genome-Wide Association Studies

Pariya Behrouzi, Danny Arends|arXiv (Cornell University)|Oct 3, 2017
Bioinformatics and Genomic Networks被引用 10
一句话总结

netgwas 是一个 R 包,利用对称图模型构建遗传图谱、推断连锁不平衡网络,并在二倍体和多倍体物种中检测基因型-表型关联。该方法通过调整所有其他变量,改进了经典方法,在高维、非正态分布及有序-连续混合型遗传数据中,通过并行化、内存优化的稀疏矩阵结构计算,实现对直接关联的检测,同时控制虚假相关性。

ABSTRACT

Graphical models are a powerful tool in modelling and analysing complex biological associations in high-dimensional data. The R-package netgwas implements the recent methodological development on copula graphical models to (i) construct linkage maps, (ii) infer linkage disequilibrium networks from genotype data, and (iii) detect high-dimensional genotype-phenotype networks. The netgwas learns the structure of networks from ordinal data and mixed ordinal-and-continuous data. Here, we apply the functionality in netgwas to various multivariate example datasets taken from the literature to demonstrate the kind of insight that can be obtained from the package. We show that our package offers a more realistic association analysis than the classical approaches, as it discriminates between direct and induced correlations by adjusting for the effect of all other variables while performing pairwise associations. This feature controls for spurious interactions between variables that can arise from conventional approaches in a biological sense. The netgwas package uses a parallelization strategy on multi-core processors to speed-up computations. The netgwas package is freely available at https://cran.r-project.org/web/packages/netgwas

研究动机与目标

  • 为多倍体物种构建遗传图谱缺乏统一、统计稳健的工具,而多倍体物种在作物中很常见,但在现有软件中代表性不足,本研究旨在解决此问题。
  • 克服传统连锁不平衡(LD)分析的局限性,后者无法检测长距离 LD,且易受群体结构和相关标记的干扰。
  • 通过调整所有其他标记和性状的影响,实现基因型与表型之间直接的、条件关联检测,减少虚假相关性。
  • 提供可扩展、并行化且内存高效的框架,用于分析高维遗传数据,包括有序和混合数据类型。
  • 支持可重现的交互式网络可视化与模拟,用于复杂育种群体中的遗传网络推断。

提出的方法

  • 使用对称图模型从高维、非正态分布及有序-连续混合型遗传数据中推断条件独立结构。
  • 采用多变量方法同时估计所有成对关系,避免顺序手动标记排序,减少中间标记带来的混杂影响。
  • 应用稀疏正则化估计邻接矩阵,以表示条件依赖网络,实现对短距离和长距离连锁不平衡的检测。
  • 实施偏相关估计以量化位点之间的直接关联,同时调整所有其他位点的影响,从而区分直接关联与诱导关联。
  • 利用多核处理器的并行计算和稀疏矩阵数据结构,优化内存使用并加速大规模数据集的计算。
  • 集成模拟功能和交互式可视化工具,用于网络探索与可重现的遗传网络分析。

实验结果

研究问题

  • RQ1能否开发一个统一框架,利用多变量图模型为二倍体和多倍体物种构建准确的遗传图谱?
  • RQ2在高维基因型数据中,如何可靠地推断连锁不平衡网络,同时考虑所有其他位点的影响?
  • RQ3与经典成对方法相比,调整所有其他变量在检测直接基因型-表型关联方面能提升多大程度的准确性?
  • RQ4对称图模型能否有效处理遗传研究中常见的混合数据类型(有序和连续),而无需假设多元正态分布?
  • RQ5在真实遗传数据集中,随着标记数和样本量的增加,该方法的计算性能如何扩展?

主要发现

  • netgwas 包成功使用多变量方法为二倍体和多倍体物种构建遗传图谱,其性能优于传统成对重组频率方法,显著减少了中间标记带来的混杂影响。
  • 通过调整所有其他位点估计偏相关,该方法能检测短距离和长距离连锁不平衡模式,揭示了标准 r² 方法所遗漏的上位性互作。
  • 计算时间与标记数 p 的立方近似成正比,且在 p × max{n, p} 能够装入内存的前提下,与样本量 n 几乎无关,从而实现对大规模数据集的高效分析。
  • 通过多核处理器的并行计算和稀疏矩阵表示的内存优化,该包实现了显著的速度提升,适用于高维遗传数据。
  • 通过条件化所有其他位点,该方法有效控制了群体结构的影响,从而减少了物理上未连锁标记之间的虚假相关性。
  • 该实现支持可重现的分析与交互式可视化,内置模拟和网络重构功能,适用于多样化的遗传研究设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。