[論文レビュー] Improving heritability estimation by a variable selection approach in sparse high dimensional linear mixed models
本稿では、スパースな高次元線形混合モデルにおける遺伝率推定法 EstHer を提案する。この手法は、まず変数選択を用いて因果的遺伝的バリアントを同定した後、最尤法を用いて遺伝率を推定することで、精度を向上させる。従来の手法と比較して、特に高スパース性下において顕著に狭い信頼区間を達成する一方で、計算コストは低く抑えられ、合成データおよび神経解剖学的 Imagen データで検証された。
Motivated by applications in neuroanatomy, we propose a novel methodology for estimating the heritability which corresponds to the proportion of phenotypic variance which can be explained by genetic factors. Estimating this quantity for neuroanatomical features is a fundamental challenge in psychiatric disease research. Since the phenotypic variations may only be due to a small fraction of the available genetic information, we propose an estimator of the heritability that can be used in high dimensional sparse linear mixed models. Our method consists of three steps. Firstly, a variable selection stage is performed in order to recover the support of the genetic effects -- also called causal variants -- that is to find the genetic effects which really explain the phenotypic variations. Secondly, we propose a maximum likelihood strategy for estimating the heritability which only takes into account the causal genetic effects found in the first step. Thirdly, we compute the standard error and the 95% confidence interval associated to our heritability estimator thanks to a nonparametric bootsrap approach. Our main contribution consists in providing an estimation of the heritability with standard errors substantially smaller than methods without variable selection when the genetic effects are very sparse. Since the real genetic architecture is in general unknown in practice, we also propose an empirical criterion which allows the user to decide whether it is relevant to apply a variable selection based approach or not. We illustrate the performance of our methodology on synthetic and real neuroanatomic data coming from the Imagen project. We also show that our approach has a very low computational burden and is very efficient from a statistical point of view.
研究の動機と目的
- 神経解剖学的特性の遺伝率を推定する課題に取り組むが、その中で因果的SNPの割合は非常に小さい。
- すべてのSNPが均等に寄与すると仮定する従来の手法の限界を克服し、不正確な遺伝率推定を避ける。
- 遺伝的効果のスパarsityを活用して統計的精度を向上させる、計算効率の良い手法を開発する。
- 変数選択に基づく(EstHer)と非選択に基づく(例:HiLMM)手法の選択を支援する意思決定基準を提供する。
- 後続の機能的解析に役立てるために、表現型の分散に寄与する生物学的に意味のあるSNPの同定を可能にする。
提案手法
- 高次元データにおける因果的遺伝的効果(非ゼロのSNP効果)のサポートを特定するため、変数選択手順(例:Lasso など)を適用する。
- 選択された因果的バリアントのみを含む低次元モデル上で、最尤法を用いて遺伝率を推定する。
- 非パラメトリックブートストラップを用いて標準誤差および95%信頼区間を計算し、頑健な推論を確保する。
- 合成データ上で推定誤差を最小化するアプローチに基づき、変数選択のしきい値をデータ駆動的にキャリブレーションする。
- さまざまなしきい値における信頼区間の重複度に基づく、変数選択が推定の安定性を向上させるかどうかを評価する経験的基準を提案する。
- 全パイプラインをRパッケージ EstHer として実装し、CRANおよび著者自身のウェブページで公開している。
実験結果
リサーチクエスチョン
- RQ1スパースな遺伝的効果を伴う高次元線形混合モデルにおいて、変数選択は遺伝率推定の精度を向上させ得るか?
- RQ2提案手法の性能は、標準の遺伝率推定器(例:HiLMM、GCTA)と比較して、信頼区間の幅および正確性の観点でどのように異なるか?
- RQ3実際の神経解剖学的データにおける変数選択の最適なしきい値は何か? また、真の遺伝的構造が事前に不明な状況で、そのしきい値をどのようにキャリブレーションできるか?
- RQ4どのような条件下で、変数選択に基づくアプローチが従来の手法よりも統計的に優位となるか?
- RQ5提案手法は、後続の機能的解析を可能にする生物学的に意味のあるSNPの集合を同定できるか?
主な発見
- EstHer は、特に因果的SNPの割合が低い(高スパース性の)状況下で、HiLMM や GCTA と比較して顕著に狭い95%信頼区間を達成する。
- pa、amy、acc などの表現型に関して、EstHer は信頼区間が狭いだけでなく、HiLMM や GCTA の信頼区間の内部に完全に含まれており、より高い精度を示している。
- Imagen データにおける変数選択の最適なしきい値は、シミュレーション全体で真の遺伝率と推定遺伝率の絶対差を最小化する基準から 0.79 に特定された。
- 経験的意思決定基準(さまざまなしきい値における信頼区間の重複度)は、EstHer が非選択手法を上回るケースを効果的に同定した。
- 本手法は低コストな計算負荷を維持しており、大規模遺伝データセットに対しても実用可能であり、オープンソースのRパッケージ EstHer として実装済みである。
- EstHer は候補となる因果的SNPのリストを提供し、標準的なLMMアプローチでは得られない生物学的インサイトを提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。