Skip to main content
QUICK REVIEW

[論文レビュー] Cross-trait prediction accuracy of high-dimensional ridge-type estimators in genome-wide association studies

Bingxin Zhao, Hongtu Zhu|arXiv (Cornell University)|Nov 22, 2019
Genetic Associations and Epidemiology参考文献 95被引用数 6
ひとこと要約

本稿は、密度的な遺伝的構造を有する高次元ゲノムワイド関連解析(GWAS)において、リッジ型推定量(マージナル推定量および最良線形不偏予測(BLUP)を含む)の予測精度を調査する。特筆すべきは、特徴量対標本数比 ω = p/n が 5 を超えると、すべての正則化パラメータ λ に対して予測の決定係数 R² がほぼ最適化され、予測精度に於いて λ の選択がほとんど意味を持たなくなることである。

ABSTRACT

Marginal association summary statistics have attracted great attention in statistical genetics, mainly because the primary results of most genome-wide association studies (GWAS) are produced by marginal screening. In this paper, we study the prediction accuracy of marginal estimator in dense (or sparsity free) high-dimensional settings with $(n,p,m) o \infty$, $m/n o γ\in (0,\infty)$, and $p/n o ω\in (0,\infty)$. We consider a general correlation structure among the $p$ features and allow an unknown subset $m$ of them to be signals. As the marginal estimator can be viewed as a ridge estimator with regularization parameter $λ o \infty$, we further investigate a class of ridge-type estimators in a unifying framework, including the popular best linear unbiased prediction (BLUP) in genetics. We find that the influence of $λ$ on out-of-sample prediction accuracy heavily depends on $ω$. Though selecting an optimal $λ$ can be important when $p$ and $n$ are comparable, it turns out that the out-of-sample $R^2$ of ridge-type estimators becomes near-optimal for any $λ\in (0,\infty)$ as $ω$ increases. For example, when features are independent, the out-of-sample $R^2$ is always bounded by $1/ω$ from above and is largely invariant to $λ$ given large $ω$ (say, $ω>5$). We also find that in-sample $R^2$ has completely different patterns and depends much more on $λ$ than out-of-sample $R^2$. In practice, our analysis delivers useful messages for genome-wide polygenic risk prediction and computation-accuracy trade-off in dense high-dimensions. We numerically illustrate our results in simulation studies and a real data example.

研究の動機と目的

  • 高次元 GWAS の設定(n,p,m)→ ∞ において、リッジ型推定量の予測精度(out-of-sample)を評価すること。
  • p と n が大きくかつ同程度の大きさである状況において、正則化パラメータ λ が予測性能に与える影響を理解すること。
  • 予測精度および標本内適合度の観点から、マージナル推定量(λ → ∞)とリッジ推定量、BLUP推定量を比較すること。
  • 特徴量対標本数比 ω = p/n が、予測精度が λ に依存する感度に与える役割を検討すること。
  • 高次元設定下での要約統計量を用いた多因子リスクスコア構築に、理論的かつ実証的指針を提供すること。

提案手法

  • SNP 間の一般相関構造 Σ を想定し、p 個の特徴量、m 個の信号、n 個の標本を有する高次元線形モデルを定式化する。
  • マージナル推定量を λ → ∞ のリッジ推定量として定式化し、BLUP を含む統一的なリッジ型推定量のクラスを分析する。
  • n,p,m → ∞ かつ m/n → γ、p/n → ω の極限において、out-of-sample R² および in-sample R² の漸近的表現を導出する。
  • 確率的行列理論と漸近的解析を用いて、予測精度が ω および λ の関数としてどのように振る舞うかを特徴付ける。
  • シミュレーション研究および実際の神経画像 GWAS データセット(PING コhort)を用いて理論的知見を検証する。
  • 独立およびブロック対角相関構造の下で、マージナル推定量、リッジ推定量、BLUP推定量の間で予測性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1高次元 GWAS において、リッジ型推定量の out-of-sample 予測精度は正則化パラメータ λ にどのように依存するか?
  • RQ2特徴量対標本数比 ω = p/n は、予測精度が λ に依存する感度にどのような影響を及ぼすか?
  • RQ3マージナル推定量(λ → ∞)の予測精度は、最適なリッジ推定量および BLUP 推定量と比べてどうか?
  • RQ4なぜ高次元設定において、in-sample R² は out-of-sample R² よりも λ に敏感なのか?
  • RQ5out-of-sample R² が λ に依存しなくなる条件は何か?そして多因子リスクスコアモデリングにどのような意味を持つのか?

主な発見

  • 特徴量対標本数比 ω = p/n > 5 のとき、リッジ型推定量の out-of-sample R² はほぼ最適化され、λ に依存しなくなる。これは真の信号割合に依存しない。
  • 独立な特徴量の下では、out-of-sample R² は上界 1/ω で抑えられ、ω が増加するにつれてこの上界に近づく。
  • マージナル推定量(λ → ∞)は ω > 5 のとき、ほぼ最適な out-of-sample R² を達成するため、この領域では λ の選択が不要となる。
  • 一方、in-sample R² は λ に強く依存するため、標本内と標本外の性能に根本的な非対称性が存在することが示唆される。
  • 最適な λ が予測に与える影響は、高次元設定(大きな ω)では小さいため、実務上は計算負荷が軽減される。
  • シミュレーションおよび PING コhort からの実証的結果は、ω > 5 のとき予測精度が λ に依存せず安定することを確認しており、要約統計量に基づく多因子リスクスコア予測の頑健性を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。