Skip to main content
QUICK REVIEW

[論文レビュー] High-dimensional genome-wide association study and misspecified mixed model analysis

Jiming Jiang, Cong Li|arXiv (Cornell University)|Apr 9, 2014
Genetic Associations and Epidemiology参考文献 27被引用数 4
ひとこと要約

この論文は、ゲノムワイド連関研究(GWAS)で一般的に用いられる高次元線形混合モデル(LMM)における制限付き最尤推定(REML)の理論的裏付けを、モデルの不適合下で提供する。SNPsのすべてが遺伝率に寄与すると仮定するが、実際にはスパースなサブセットのみが寄与する状況においても、分散成分のREML推定量が一貫性を示し、$O_P(\sqrt{\log n/n})$ の収束速度を示し、漸近正規性を満たすことを証明する。これにより、実践におけるLMMベースの遺伝率推定の頑健性が裏付けられる。

ABSTRACT

We study behavior of the restricted maximum likelihood (REML) estimator under a misspecified linear mixed model (LMM) that has received much attention in recent gnome-wide association studies. The asymptotic analysis establishes consistency of the REML estimator of the variance of the errors in the LMM, and convergence in probability of the REML estimator of the variance of the random effects in the LMM to a certain limit, which is equal to the true variance of the random effects multiplied by the limiting proportion of the nonzero random effects present in the LMM. The aymptotic results also establish convergence rate (in probability) of the REML estimators as well as a result regarding convergence of the asymptotic conditional variance of the REML estimator. The asymptotic results are fully supported by the results of empirical studies, which include extensive simulation studies that compare the performance of the REML estimator (under the misspecified LMM) with other existing methods.

研究の動機と目的

  • 高次元ゲノムワイド連関研究(GWAS)における線形混合モデル(LMM)の広範な使用に対する理論的裏付けを提供すること。
  • 真のモデルがスパース(SNPsの一部のみが非ゼロ効果を持つ)であるが、仮定されるLMMではすべてのSNPsをランダム効果として扱う場合の制限付き最尤(REML)推定量の漸近的性質を調査すること。
  • 標本サイズとランダム効果の数が両方とも増加する高次元漸近的条件下で、REML推定量の一致性、収束速度、漸近的分散の性質を確立すること。
  • 不適合混合モデル解析(MMMA)の概念を導入・形式化し、高次元設定におけるその漸近的性質を明らかにすること。

提案手法

  • 著者らは、ランダム効果の数が標本サイズとともに増加する高次元LMMにおけるREML推定量の漸近的性質を分析する。
  • ランダム行列理論(RMT)を用いて、特に誤差分散とランダム効果分散のREML推定量の極限分布を導出する。
  • 真のモデルがスパース(SNPsの一部のみが非ゼロ効果を持つ)であるが、仮定されるLMMではすべてのSNPsをランダム効果として扱う設定を検討する。
  • 主な方程式には、誤差分散のREML推定量 $\hat{\sigma}_\epsilon^2$ と分散成分比 $\hat\gamma$ の漸近的挙動が含まれ、マルティングールおよびトレースに基づく議論により収束速度が導かれる。
  • 条件付きモーメントと分散分解を用いた導出により、$\hat{\sigma}_\epsilon^2 - \sigma_{\epsilon 0}^2 = O_P(\sqrt{\log n/n})$ および $\hat{\gamma} - \gamma_* = O_P(\sqrt{\log n/n})$ が示され、ここで $\gamma_*$ は非ゼロランダム効果の割合の極限値である。
  • 理論的結果は、REMLの不適合下での性能と他の手法を比較する包括的なシミュレーションスタディにより裏付けられる。これにより、漸近的予測の妥当性が検証される。

実験結果

リサーチクエスチョン

  • RQ1すべてのSNPsをランダム効果として扱うが、真のモデルではスパースなサブセットのみが活性である場合に、REML推定量が分散成分についても一貫性を示すか?
  • RQ2高次元漸近的条件下で、誤差分散および分散成分比のREML推定量の収束速度は何か?
  • RQ3REML推定量の漸近的条件付き分散はどのように振る舞い、有限標本下の性能と整合的か?
  • RQ4高次元GWASにおけるモデルの不適合下でも、遺伝率のREML推定量は理論的に正当化できるか?
  • RQ5ランダム効果の数と標本サイズが両方とも無限大に近づくとき、REML推定量の極限的挙動は何か?

主な発見

  • 誤差分散のREML推定量は、モデルの不適合下でも一貫性を示し、標本サイズが増加するにつれて真の値に確率的に収束する。
  • ランダム効果分散のREML推定量は、真の分散に非ゼロランダム効果の割合の極限値を乗じた値に確率的に収束する。
  • 両方のREML推定量の収束速度は $O_P(\sqrt{\log n/n})$ であり、高次元性のため、古典的な $O_P(n^{-1/2})$ の速度より遅い。
  • REML推定量の漸近的条件付き分散は確率的に定数に収束し、高次元漸近的条件下での推論の有効性を支持する。
  • シミュレーションスタディにより理論的予測が確認され、REMLは他の手法と比較して不適合下でも頑健に機能することが示された。
  • これらの結果は、LMMベースの遺伝率推定の実践的使用に理論的根拠を提供し、『欠落した遺伝率』のパラドックスに対する懸念を解消する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。