Skip to main content
QUICK REVIEW

[論文レビュー] netgwas: An R Package for Network-Based Genome-Wide Association Studies

Pariya Behrouzi, Danny Arends|arXiv (Cornell University)|Oct 3, 2017
Bioinformatics and Genomic Networks被引用数 10
ひとこと要約

netgwas は、二倍体および多倍体種における遺伝マップの構築、連鎖不平衡ネットワークの同定、および遺伝子型-表現型関連の検出に、コーパラグラフィカルモデルを用いる R パッケージである。この手法は、すべての他の変数を調整することで、高次元で非ガウス分布であり、順序尺度と連続尺度が混在する遺伝データにおいて、誤った相関関係を制御しながら直接関連を検出できる。並列処理とメモリ最適化されたスパース行列構造を用いることで、古典的手法を改善する。

ABSTRACT

Graphical models are a powerful tool in modelling and analysing complex biological associations in high-dimensional data. The R-package netgwas implements the recent methodological development on copula graphical models to (i) construct linkage maps, (ii) infer linkage disequilibrium networks from genotype data, and (iii) detect high-dimensional genotype-phenotype networks. The netgwas learns the structure of networks from ordinal data and mixed ordinal-and-continuous data. Here, we apply the functionality in netgwas to various multivariate example datasets taken from the literature to demonstrate the kind of insight that can be obtained from the package. We show that our package offers a more realistic association analysis than the classical approaches, as it discriminates between direct and induced correlations by adjusting for the effect of all other variables while performing pairwise associations. This feature controls for spurious interactions between variables that can arise from conventional approaches in a biological sense. The netgwas package uses a parallelization strategy on multi-core processors to speed-up computations. The netgwas package is freely available at https://cran.r-project.org/web/packages/netgwas

研究の動機と目的

  • 多倍体種における遺伝マップの構築に統一的かつ統計的に堅牢なツールが不足していることに対処すること。多倍体種は作物において一般的であるが、既存のソフトウェアでは十分にカバーされていない。
  • 従来の連鎖不平衡(LD)解析に見られる限界を克服すること。特に、長距離 LD を検出できないこと、集団構造や相関するマーカーによって歪められること。
  • すべての他のマーカーおよび特徴量の影響を調整することで、遺伝子型と表現型の直接的・条件付き関連を検出できること。これにより、誤った相関関係が低減する。
  • 高次元で、順序尺度と混合されたデータタイプを含む遺伝データを効率的に分析できる、スケーラブルで並列処理可能かつメモリ効率の良いフレームワークを提供すること。
  • 複雑な育種集団における遺伝ネットワーク推定のための再現可能でインタラクティブなネットワーク可視化およびシミュレーションを支援すること。

提案手法

  • 高次元で非ガウス分布であり、順序尺度と連続尺度が混在する遺伝データから、条件付き独立構造を推定するためにコーパラグラフィカルモデルを用いる。
  • すべてのペアワイズ関係を同時に推定する多変量アプローチを採用し、逐次的で手動のマーカー順序付けを回避。これにより、中間マーカーによる混同が低減する。
  • スパース正則化を用いて、条件付き依存ネットワークを表す隣接行列を推定。これにより、短距離および長距離の連鎖不平衡を検出可能となる。
  • 偏相関係数推定を実装し、すべての他の遺伝座を調整した上で、遺伝座間の直接的関連を定量的に評価。これにより、直接的相関と誘導的相関を区別可能となる。
  • マルチコアプロセッサ上で並列処理を実装し、スパース行列データ構造を用いることで、メモリ使用量を最適化し、大規模データセットの処理を高速化。
  • ネットワーク探索と再現性の確保のため、シミュレーション関数およびインタラクティブ可視化ツールを統合。遺伝ネットワーク解析に適したフレームワークを提供。

実験結果

リサーチクエスチョン

  • RQ1二倍体および多倍体種の両方において、多変量グラフィカルモデルを用いて、統一的フレームワークで正確な遺伝マップを構築できるか?
  • RQ2すべての他の遺伝座の影響を考慮しつつ、高次元のゲノムデータから連鎖不平衡ネットワークを信頼性高く推定できるか?
  • RQ3すべての他の変数を調整することで、古典的手法のペアワイズ法と比較して、直接的遺伝子型-表現型関連の検出がどの程度向上するか?
  • RQ4コーパラグラフィカルモデルは、多様な遺伝研究で一般的な順序尺度と連続尺度の混合データタイプを、多変量正規分布を仮定せずに効果的に扱えるか?
  • RQ5実際の遺伝データセットにおいて、マーカー数とサンプルサイズの増加に伴い、この手法の計算パフォーマンスはどのようにスケーリングするか?

主な発見

  • netgwas パッケージは、中間マーカーによる混同を低減する多変量アプローチを用いて、二倍体および多倍体種の両方で遺伝マップを正確に構築した。これは、従来のペアワイズ再結合頻度法を上回る性能を示した。
  • すべての他の遺伝座を調整した偏相関係数推定により、短距離および長距離の連鎖不平衡パターンを検出可能となった。これにより、標準的な r² に基づくアプローチが見逃すエピスタシス相互作用が明らかになった。
  • 計算時間はマーカー数 p に対して概ね p³ のスケーリングを示し、サンプルサイズ n にほとんど依存しない。ただし、p × max{n, p} がメモリに収まる限り、大規模データセットの効率的解析が可能である。
  • マルチコアプロセッサでの並列処理とスパース行列表現によるメモリ最適化により、顕著な高速化が達成された。これにより、高次元遺伝データに適した処理が可能となった。
  • すべての他の遺伝座を条件付けすることで、集団構造の影響を効果的に制御し、物理的に非連鎖するマーカー間の誤った相関関係を低減した。
  • 再現可能な解析とインタラクティブ可視化を実現。多様な遺伝研究設計に対応する、組み込みのシミュレーション関数およびネットワーク再構築機能を備える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。