[論文レビュー] A model selection approach to genome wide association studies
本稿では、複雑な形質における因果的SNPの検出を向上させるために、修正ベイズ情報量基準(mBICおよびmBIC2)を用いた全ゲノム関連解析(GWAS)のモデル選択手法を提案する。個々のSNPを別々にテストするのではなく、複数のSNPを同時にモデル化することで、統計的パワーを向上させ、SNP間の誤った相関が引き起こす偽陽性を低減する。シミュレーションおよびHapMap遺伝子発現データを用いた実データ解析において、従来の多重検定手法を上回る性能を示した。
For the vast majority of genome wide association studies (GWAS) published so far, statistical analysis was performed by testing markers individually. In this article we present some elementary statistical considerations which clearly show that in case of complex traits the approach based on multiple regression or generalized linear models is preferable to multiple testing. We introduce a model selection approach to GWAS based on modifications of Bayesian Information Criterion (BIC) and develop some simple search strategies to deal with the huge number of potential models. Comprehensive simulations based on real SNP data confirm that model selection has larger power than multiple testing to detect causal SNPs in complex models. On the other hand multiple testing has substantial problems with proper ranking of causal SNPs and tends to detect a certain number of false positive SNPs, which are not linked to any of the causal mutations. We show that this behavior is typical in GWAS for complex traits and can be explained by an aggregated influence of many small random sample correlations between genotypes of a SNP under investigation and other causal SNPs. We believe that our findings at least partially explain problems with low power and nonreplicability of results in many real data GWAS. Finally, we discuss the advantages of our model selection approach in the context of real data analysis, where we consider publicly available gene expression data as traits for individuals from the HapMap project.
研究の動機と目的
- 単一マーカー検定の限界、特に複雑な遺伝的構造における低検出力と高い偽陽性率を解消すること。
- 高次元のSNPデータで真の信号が少ない状況に適した、修正BIC基準(mBICおよびmBIC2)に基づくモデル選択フレームワークの構築。
- シミュレーションおよび実データ解析を通じて、モデル選択が因果的SNPの検出および正確な順位付けにおいて多重検定を上回ることを示すこと。
- 因果的でないSNPと因果的SNPの間のランダムな相関が、単一マーカー検定におけるp値順序の不安定さを引き起こす理由を説明すること。
- HapMap遺伝子発現データにおいて、従来の多重検定手法では検出されなかった新たな*trans*-作用SNP関連を同定すること。
提案手法
- 単変量検定の制限を回避するため、複数のSNPを同時にモデル化する重回帰または一般化線形モデルの枠組みを採用する。
- 高次元設定およびスパース信号検出に適したペナルティを備えたmBICおよびmBIC2をモデル選択基準として使用する。
- 二段階の探索戦略を適用:まずフォワード選択またはスクリーニングにより有望なSNP集合を特定し、次に局所探索またはステップワイズ法で最適化を実施する。
- mBIC2はmBICよりも広いスパarsity条件下で漸近的最適性を示し、モデル選択の一貫性が向上することを活用する。
- HapMapプロジェクトの実際のSNPデータを用いてGWASデータをシミュレートし、現実的な遺伝的相関構造下でのモデル性能を検証する。
- 標準的な多重検定手順と比較して、検出力、偽発見率、および真の因果的SNPの検出という観点からモデル選択の結果を評価する。
実験結果
リサーチクエスチョン
- RQ1mBICまたはmBIC2を用いたモデル選択は、複雑な遺伝的モデルにおける因果的SNPの検出において、単一マーカー検定よりも高い統計的パワーを示すか?
- RQ2因果的でないSNPと因果的SNPの間のランダムな相関が、単一マーカーGWASにおけるp値順序をどの程度歪めるか?
- RQ3モデル選択手法は、多重検定アプローチが見逃す生物学的に有意な*trans*-作用SNP関連を検出できるか?
- RQ4mBICおよびmBIC2は、高次元的かつスパースなGWAS設定下で、モデル選択の一貫性および偽陽性の制御においてどの程度の性能を示すか?
- RQ5サンプルサイズの増大が、実際のGWASデータにおける複雑な複数SNP関連の同定能力に与える影響は何か?
主な発見
- mBICおよびmBIC2を用いたモデル選択は、複数の相互作用を示す遺伝子座を含む複雑なモデルにおいて、多重検定を著しく上回る性能を示した。
- 単一マーカー検定は、モデルに組み込まれていない因果的変異が残差平方和を著しく増加させることにより、低検出力に陥る。これは多重検定補正では解消できない主要な限界である。
- 因果的でないSNPと因果的SNPの間の小さなランダム相関が、誤ったp値順序を引き起こし、偽陽性と真の因果的変異の検出漏れを同時に生じさせる。
- HapMap遺伝子発現形質の実データ解析において、mBIC2は元の多重検定解析で検出されなかった新たな*trans*-SNPを同定した。特に、元の研究で見逃された*cis*-SNPも含まれていた。
- モデル選択手法により、複数の遺伝子にまたがる共有の調節領域が同定された。例えば、染色体6番(32.5–32.8 Mb)に強い信号が検出され、複数の*trans*-SNPが因果的変異と高相関を示した。
- サンプルサイズが小さいためモデルの複雑さに制限(最大11個のSNP)が生じたが、生物学的に妥当な関連が同定された。これは、より大きなコhortではさらなる可能性が示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。