Skip to main content
QUICK REVIEW

[論文レビュー] On Genetic Correlation Estimation With Summary Statistics From Genome-Wide Association Studies

Bingxin Zhao, Hongtu Zhu|arXiv (Cornell University)|Mar 4, 2019
Genetic Associations and Epidemiology参考文献 59被引用数 4
ひとこと要約

この論文は、非常に多因子的またはオミニジェニックな特性において、遺伝的相関を系統的に低く評価する根本的な漸近的バイアスを特定し、是正する。著者らは、GWAS要約統計のみに依存する一貫したPRS推定器と、新しい遺伝的相関推定器を提案し、バイアスが原因となるSNP数とは独立して、(n, p, h²)に起因することを示した。UK Biobankデータを用いた有限標本検証により、その妥当性を裏付けた。

ABSTRACT

Cross-trait polygenic risk score (PRS) method has gained popularity for assessing genetic correlation of complex traits using summary statistics from biobank-scale genome-wide association studies (GWAS). However, empirical evidence has shown a common bias phenomenon that highly significant cross-trait PRS can only account for a very small amount of genetic variance (<i>R</i><sup>2</sup> can be &lt;1%) in independent testing GWAS. The aim of this paper is to investigate and address the bias phenomenon of cross-trait PRS in numerous GWAS applications. We show that the estimated genetic correlation can be asymptotically biased toward zero. A consistent cross-trait PRS estimator is then proposed to correct such asymptotic bias. In addition, we investigate whether or not SNP screening by GWAS <i>p</i>-values can lead to improved estimation and show the effect of overlapping samples among GWAS. We analyze GWAS summary statistics of reaction time and brain structural magnetic resonance imaging-based features measured in the Pediatric Imaging, Neurocognition, and Genetics study. We find that the raw cross-trait PRS estimators heavily underestimate the genetic similarity between cognitive function and human brain structures (mean R2=1.32%), whereas the bias-corrected estimators uncover the moderate degree of genetic overlap between these closely related heritable traits (mean R2=22.42%). Supplementary materials for this article, including a standardized description of the materials available for reproducing the work, are available as an online supplement.

研究の動機と目的

  • 非常に顕著なクロストレイトPRSが、強い遺伝的オーバーラップがあるにもかかわらず、遺伝的分散の1%未満しか説明しないという、長年の経験的現象を解消すること。
  • 多因子的またはオミニジェニックな構造下で、PRSからの遺伝的相関推定値が漸近的にゼロに偏る理論的根拠を示すこと。
  • 未知の原因SNP数に依存せず、この漸近的バイアスを是正する一貫したPRS推定器を構築すること。
  • 個別データを必要とせず、GWAS要約統計のみに依存する新しい遺伝的相関推定器を提案すること。
  • p値によるSNPスクリーニングと重複サンプルの影響が、推定精度とバイアスに与える影響を調査すること。

提案手法

  • すべてのp個のSNPを含む多因子的モデル下でのPRS推定の理論的分析により、漸近的バイアスが原因SNP数mとは独立し、(n, p, h²)にのみ依存することを示した。
  • 高次元設定における非原因SNPの影響を補正することで、漸近的バイアスを除去する一貫したPRS推定器の導出。
  • 2つのGWAS要約統計セットに基づく、新しい遺伝的相関推定器の開発。PRS予測からの共分散および分散成分を用いる。
  • 次第に増加する次元と標本サイズの下での高次元的漸近理論の適用。mαβ、mα、mβ、およびpがnとともに増加する条件を設定。
  • ランダム行列理論と集中不等式を用いて、仮説検定統計量および相関推定器の漸近的挙動を導出。
  • 数値シミュレーションと、脳の白色内線維および神経精神疾患に関するUK Biobankデータの分析を通じた有限標本検証。

実験結果

リサーチクエスチョン

  • RQ1なぜクロストレイトPRS手法は、顕著な関連があるにもかかわらず、非常に多因子的特性において遺伝的相関を系統的に低く評価するのか?
  • RQ2多因子的またはオミニジェニックモデル下で、PRSに基づく遺伝的相関推定値に生じる漸近的バイアスの理論的起源は何か?
  • RQ3未知の原因SNP数に依存せず、漸近的バイアスを除去する一貫したPRS推定器を構築できるか?
  • RQ4GWASのp値によるSNPスクリーニングは、高次元設定における遺伝的相関推定の精度を向上させるか?
  • RQ5GWASデータセット間の重複サンプルは、遺伝的相関推定のバイアスと分散にどのような影響を及えるか?

主な発見

  • 遺伝的相関の推定値は、多因子的またはオミニジェニックな特性において、標本サイズが大きくても、漸近的にゼロに偏る。
  • PRS推定器の漸近的バイアスは、原因SNP数mに依存せず、標本サイズn、SNP数p、SNPヒト性度h²の三つ組み(n, p, h²)にのみ依存する。
  • 提案された一貫したPRS推定器は、この漸近的バイアスを効果的に除去し、高次元設定下での遺伝的相関の正確な推定を可能にする。
  • GWAS要約統計のみに依存する新しい遺伝的相関推定器は、同じ漸近的条件下で一貫した推定を達成する。
  • 数値実験とUK Biobankデータ分析により、バイアス補正済みPRS推定器が遺伝的オーバーラップのR²を著しく向上させ、『欠落した遺伝的オーバーラップ』のパラドックスを解消することが確認された。
  • p値によるSNPスクリーニングは推定精度を向上させず、むしろバイアスを悪化させる可能性がある。一方、重複サンプルは追加のバイアスを引き起こすため、解析時にこれを考慮する必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。