Skip to main content
QUICK REVIEW

[論文レビュー] varbvs: Fast Variable Selection for Large-scale Regression

Peter Carbonetto, Xiang Zhou|arXiv (Cornell University)|Sep 19, 2017
Genetic and phenotypic traits in livestock参考文献 1被引用数 10
ひとこと要約

この論文では、変分ベイズ推論を用いて高次元データにおける重要な予測子を効率的に同定する、大規模回帰における高速なベイズ変数選択法varbvsを提案する。計算量は線形であり、標準のラップトップでも4分未満で正確な後方分布推論が可能であり、遺伝的データにおける真の形質座標遺伝子座(QTL)の同定において、単一マーカー法を上回る性能を発揮する。

ABSTRACT

We introduce varbvs, a suite of functions written in R and MATLAB for regression analysis of large-scale data sets using Bayesian variable selection methods. We have developed numerical optimization algorithms based on variational approximation methods that make it feasible to apply Bayesian variable selection to very large data sets. With a focus on examples from genome-wide association studies, we demonstrate that varbvs scales well to data sets with hundreds of thousands of variables and thousands of samples, and has features that facilitate rapid data analyses. Moreover, varbvs allows for extensive model customization, which can be used to incorporate external information into the analysis. We expect that the combination of an easy-to-use interface and robust, scalable algorithms for posterior computation will encourage broader use of Bayesian variable selection in areas of applied statistics and computational biology. The most recent R and MATLAB source code is available for download at Github (https://github.com/pcarbo/varbvs), and the R package can be installed from CRAN (https://cran.r-project.org/package=varbvs).

研究の動機と目的

  • 高次元回帰設定における計算的に効率的なベイズ変数選択法の開発。
  • 全ゲノム関連解析のような大規模な遺伝的データにおける変数包含確率の正確な推論の実現。
  • 従来のマルコフ連鎖モンテカルロ法や単一マーカー手法と比較して、計算負荷を低減しつつ統計的精度を維持すること。
  • 数千の予測子とサンプルを扱う現実世界の応用に適した数値的に安定でスケーラブルな実装の提供。
  • 妥当な事前分布の選択と後方分布の近似を通じた不確実性の定量化の支援。

提案手法

  • 変数間の条件付き独立性仮定に基づき、変数の共同後方分布の変分近似を採用する。
  • 座標昇降法を用いて、周辺対数尤度の下界を最適化し、サンプルサイズおよび予測子数の両方で線形時間スケーリングを達成する。
  • 特にXᵀDXの対角成分の計算において、数値的に安定した更新を実装し、浮動小数点誤差による早期収束を回避する。
  • ベイズ線形モデルの先行研究に基づくデフォルト事前分布を提供し、ハイパーパrameterは経験ベイズ法で推定することで、事前分布選択への感度を低減する。
  • 被験者(例:体重)と、すべてのSNPを同時に表現型(例:精巣重量)の予測子として統合的にモデル化する。
  • 各変数の後方包含確率(PIP)を計算し、染色体グループごとの可視化により関心領域を同定可能。

実験結果

リサーチクエスチョン

  • RQ1数千の予測子を有する大規模回帰において、高速な変分推論法が正確な変数選択を達成できるか。
  • RQ2遺伝的データにおける真の形質座標遺伝子座(QTL)を同定する際、マルチマーカー法と単一マーカー法とを比較すると、どちらが優れているか。
  • RQ3高次元ベイズモデルにおいて、行列演算の数値的不安定性が収束性および解の品質に与える影響はどの程度か。
  • RQ4ハイパーパrameterの広範なチューニングを要せず、デフォルト事前分布が頑健な推論を提供できるか。
  • RQ5変分パラメータの初期化に結果がどれほど依存するか。初期化戦略により収束性は向上するか。

主な発見

  • varbvsアルゴリズムは、993匹のマウスと79,748個のSNPを用いた解析を、標準のラップトップで4分未満で完了し、高い計算効率を示した。
  • 後方包含確率が0.5を超えるSNPはわずか3つであり、体重を調整した後でも、精巣重量の残差分散の15%を説明した。
  • トップSNP(rs6279141)の後方包含確率は1.00であり、分散の6.31%を説明した。このSNPは、精巣形成に関連するInhba遺伝子の近くに位置していた。
  • 単一マーカー解析では見逃された染色体2番のQTLが、マルチマーカーモデリングにより同定された。これは、相関する信号を検出する際のマルチマーカーモデリングの利点を示している。
  • 行列演算の順序を再編することで、数値的安定性が著しく向上した。より安定した更新(xdx2)は滑らかな収束を実現し、早期終了を回避した。
  • varbvsによる後方包含確率は、単一マーカーのp値と強く一致しており、SNP間の相関を考慮しつつ真の関連を正しく同定できる能力を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。