Skip to main content
QUICK REVIEW

[論文レビュー] Detection of correlation between genotypes and environmental variables. A fast computational approach for genomewide studies

G. Guillot|arXiv (Cornell University)|Jun 5, 2012
Genetic and phenotypic traits in livestock参考文献 8被引用数 6
ひとこと要約

本稿では、空間的集団構造を考慮し、アレルル頻度と環境変数の相関を検出するため、INLA-SPDEフレームワークを用いた高速でMCMCを不要とする空間的一般化線形混合モデル(SGLMM)を提案する。従来のMantel検定やロジスティック回帰と比較して、空間的依存性を明示的にモデル化することで、全ゲノム研究における選択下の遺伝子座の検出を向上させる。

ABSTRACT

Genomic regions (or loci) displaying outstanding correlation with some environmental variables are likely to be under selection and this is the rationale of recent methods of identifying selected loci and retrieving functional information about them. To be efficient, such methods need to be able to disentangle the potential effect of environmental variables from the confounding effect of population history. For the routine analysis of genome-wide datasets, one also needs fast inference and model selection algorithms. We propose a method based on an explicit spatial model which is an instance of spatial generalized linear mixed model (SGLMM). For inference, we make use of the INLA-SPDE theoretical and computational framework developed by Rue et al. (2009) and Lindgren et al (2011). The method we propose allows one to quantify the correlation between genotypes and environmental variables. It works for the most common types of genetic markers, obtained either at the individual or at the population level. Analyzing simulated data produced under a geostatistical model then under an explicit model of selection, we show that the method is efficient. We also re-analyze a dataset relative to nineteen pine weevils (Hylobius abietis}) populations across Europe. The method proposed appears also as a statistically sound alternative to the Mantel tests for testing the association between genetic and environmental variables.

研究の動機と目的

  • 大規模なゲノムデータセットにおける遺伝子マーカーと環境変数の相関を検出する計算的に効率的な手法の開発。
  • 選択スキャンにおける集団歴の混同要因と空間的集団構造を考慮すること。
  • 空間相関下で無効であると知られているMantel検定の統計的に妥当な代替手法を提供すること。
  • MCMCを回避することでモデル選択とベイズ推論を可能にし、全ゲノム解析へのスケーラビリティを確保すること。
  • ドミナント(AFLP)およびコドミナント(SNP)マーカーを含む、個体レベルおよび集団レベルのゲノムデータを両方取り扱えること。

提案手法

  • 空間的一般化線形混合モデル(SGLMM)を採用し、三角形メッシュ上にガウスMarkovランダムフィールド(GMRF)を用いて空間的ランダム効果をモデル化する。
  • 計算効率を高めるために、SPDEアプローチを用いてマテrn空間相関関数を近似する。
  • 計算負荷の高いMCMCサンプリングを回避するため、統合ネストラス近似(INLA)を用いて推論を実施する。
  • 環境変数を固定効果として含め、定量的およびカテゴリカルな予測子を両方扱える。
  • モデル比較にはベイズ因子を用い、各遺伝子座における環境関連性の証拠を評価する。
  • 平面上(R²)および球面上(S²)の両方の空間的領域に適用可能であり、大陸規模の研究に適している。

実験結果

リサーチクエスチョン

  • RQ1空間的明示的モデルは、ロジスティック回帰などの非空間的手法と比較して、選択下の遺伝子座の検出を改善できるか?
  • RQ2空間的集団構造を考慮することで、ゲノタイプ-環境関連性研究における統計的検出力および第一種過誤率にどのような影響を与えるか?
  • RQ3空間自己相関が存在する状況で、提案されたSGLMMはMantel検定をどの程度上回るか?
  • RQ4既知の選択および拡散レジーム下で、シミュレーションデータにおいて真の選択信号をどの程度正確に回復できるか?
  • RQ5実世界のゲノムデータ(例:マツコ walk データセット)において、本手法は信頼性高く選択下の候補遺伝子座を同定できるか?

主な発見

  • 地理統計的モデル下のシミュレーションでは、SGLMMは遺伝的変動の空間的パターンを正しく回復し、真の環境相関を検出できた。
  • 生物学的に現実的な選択モデル下では、選択下の20個の遺伝子座(インデックス101–120)を100%検出でき、高い後確率と強いベイズ因子を示した。
  • マツコ walk データセットにおいて、SGLMMは日間気温差に関してわずか3つの有意な遺伝子座(BF > 3)を同定したのに対し、単純なロジスティック回帰では11個が有意であった。これは、誤検出の減少を示している。
  • 他の環境変数(凍結日数、降水量、風速)に関しては、SGLMMでは有意な関連性が検出されなかった(0個)。これは、第一種過誤のより良い制御を示している。
  • SGLMMと以前の解析(Joost et al., 2008)との間に強く一致する結果が得られ、本手法の信頼性を裏付けた。
  • 本手法は計算効率とスケーラビリティを示し、MCMCを伴わない全ゲノムデータセットの日常的解析に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。