Skip to main content
QUICK REVIEW

[論文レビュー] REMI: Regression with marginal information and its application in genome-wide association studies

Jian Huang, Yuling Jiao|arXiv (Cornell University)|May 3, 2018
Genetic Associations and Epidemiology参考文献 39被引用数 4
ひとこと要約

本稿では、個別レベルのデータにアクセスできない状況下でも、限られたリファレンスパネルとマージナル要約統計のみを用いて高次元係数を推定する、新しい$\mu\text{atext{1}}$正則化回帰手法REMIを提案する。REMIは、完全な個別データを用いたLassoと同等の推定誤差を達成する。本手法は、個人データへのアクセスが制限される高次元設定下で、最小最大最適誤差率に達することを理論的に保証する。

ABSTRACT

In this study, we consider the problem of variable selection and estimation in high-dimensional linear regression models when the complete data are not accessible, but only certain marginal information or summary statistics are available. This problem is motivated from the Genome-wide association studies (GWAS) that have been widely used to identify risk variants underlying complex human traits/diseases. With a large number of completed GWAS, statistical methods using summary statistics become more and more important because of restricted accessibility to individual-level data sets. Theoretically guaranteed methods are highly demanding to advance the statistical inference with a large amount of available marginal information. Here we propose an $\ell_1$ penalized approach, REMI, to estimate high dimensional regression coefficients with marginal information and external reference samples. We establish an upper bound on the error of the REMI estimator, which has the same order as that of the minimax error bound of Lasso with complete individual-level data. In particular, when marginal information is obtained from a large number of samples together with a small number of reference samples, REMI yields good estimation and prediction results, and outperforms the Lasso because the sample size of accessible individual-level data can be limited. Through simulation studies and real data analysis of the NFBC1966 GWAS data set, we demonstrate that REMI can be widely applicable. The developed R package and the codes to reproduce all the results are available at https://github.com/gordonliu810822/REMI

研究の動機と目的

  • 個別レベルのデータが入手不可な状況下で、マージナル要約統計のみに依存して高次元変数選択と推定を実行する課題に対処すること。
  • 外部リファレンスパネルを活用して回帰係数を推定する理論的裏付けのある手法を、全ゲノム関連解析(GWAS)に適用すること。
  • 完全な個別レベルのデータを用いたLassoと同等の推定精度を達成すること、ただし、生の遺伝子型および表現型データへのアクセスが制限されている状況でも同様に実現すること。
  • 大規模な遺伝学的研究における従来の回帰手法のスケーラブルでプライバシーを配慮した代替手法を提供すること。

提案手法

  • REMIは、各予測子$j$についてのマージナル統計$\mathbf{X}_j^T\mathbf{y}$および$\mathbf{X}_j^T\mathbf{X}_j$に加え、設計行列の共分散構造を推定するためのリファレンスパネル$\mathbf{X}_r$を用いて、正則化された最適化問題を定式化する。
  • 本手法は、マージナル相関と推定分散に基づく損失関数を最小化する$\ell_1$正則化推定量を採用し、リファレンスパネルを用いて設計行列の共分散を近似する。
  • 完全なデータが利用可能な場合のLassoの最小最大誤差率と一致する推定誤差の上界を導出する。これは、標準的な高次元仮定の下で成り立つ。
  • 理論的分析では、リファレンスパネルの共分散行列に対する制限固有値条件と、マージナル統計における推定誤差の確率的バウンドに依存する。
  • リファレンスパネルサイズ$n_r$が予測子数$p$に比べて小さい場合でも、本手法はマージナル推定値のノイズに強く、$n_r \ll p$の条件下で一貫性を保つ。
  • 再現性と実際のGWASデータへの応用を目的として、Rパッケージを実装し、公開している。

実験結果

リサーチクエスチョン

  • RQ1個別レベルのデータにアクセスできない状況下で、マージナル要約統計と小さなリファレンスパネルのみを用いて、高次元回帰係数を正確に推定できるか?
  • RQ2個別レベルのデータが入手不可な状況下でも、完全なデータを用いたLassoと同等の推定誤差を達成できるか?
  • RQ3生のデータへのアクセスが限られる高次元漸近的設定下で、このような手法に理論的保証を付与できるか?
  • RQ4リファレンスパネルサイズが予測子数に比べて小さい場合、実世界のGWASデータに対して本手法は実際にどの程度の性能を示すか?
  • RQ5マージナル推定値にノイズやバイアスが含まれる状況下でも、予測精度と変数選択の一貫性を維持できるか?

主な発見

  • REMIは、完全な個別レベルのデータが利用可能な場合のLassoの最小最大最適誤差率と一致する推定誤差バウンドを達成する。これは、標準的な高次元仮定の下で成り立つ。
  • 誤差バウンドは、$\mathcal{O}\left(\sigma_\epsilon \sqrt{\frac{s \log p}{n}} + \sqrt{\frac{s \log p}{n_r}}\right)$とスケーリングされ、ここで$s$はスパarsity、$n$は主研究のサンプルサイズ、$n_r$はリファレンスパネルサイズを表す。
  • 理論的分析により、高確率($\geq 1 - 3/p^2 - 1/p^3$)で推定量が誤差制御に必要な条件を満たすことが示された。
  • シミュレーション研究では、マージナル統計のみが利用可能な状況下で、REMIが標準Lassoを上回ることを確認した。特にリファレンスパネルが小さい場合に顕著であった。
  • NFBC1966 GWASデータセットを用いた実データ解析では、完全なデータを用いた手法と比較して、REMIが競争力のある予測性能と変数選択性能を示した。
  • リファレンスパネルを用いた共分散推定のおかげで、マージナル統計が大規模だがノイズの多い要約データから推定されても、本手法はロバスト性と一貫性を保った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。