Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Bayesian Variable Selection for Structured High-dimensional Data

Changgee Chang, Suprateek Kundu|arXiv (Cornell University)|Apr 25, 2016
Statistical Methods and Inference参考文献 28被引用数 5
ひとこと要約

本論文は、既知のグラフに従って構造化された高次元データに対してスケーラブルなベイジアン変数選択手法を提案する。この手法は、スケーリングパrameterにグラフ正則化付きのラプラス事前分布を用いた適応的スhrinkageを実装し、EMアルゴリズムを用いて計算スケーラビリティを達成している。p ~ 100,000まで計算が可能であり、固定次元および増大次元の両方において予測性能、変数選択性能、理論的一貫性に優れ、グラフが誤って指定された場合でも強固である。

ABSTRACT

Variable selection for structured covariates lying on an underlying known graph is a problem motivated by practical applications, and has been a topic of increasing interest. However, most of the existing methods may not be scalable to high dimensional settings involving tens of thousands of variables lying on known pathways such as the case in genomics studies. We propose an adaptive Bayesian shrinkage approach which incorporates prior network information by smoothing the shrinkage parameters for connected variables in the graph, so that the corresponding coefficients have a similar degree of shrinkage. We fit our model via a computationally efficient expectation maximization algorithm which scalable to high dimensional settings (p~100,000). Theoretical properties for fixed as well as increasing dimensions are established, even when the number of variables increases faster than the sample size. We demonstrate the advantages of our approach in terms of variable selection, prediction, and computational scalability via a simulation study, and apply the method to a cancer genomics study.

研究の動機と目的

  • 予測子が既知のグラフ(例:ゲノミクスにおける遺伝子経路)に従って構造化された高次元データにおける変数選択の課題に対処すること。
  • ネットワーク情報の事前知識を組み込むベイジアンアプローチを開発し、接続された変数に対して類似したスクリンギングを促進することで、変数選択と予測性能を向上させること。
  • MCMCに基づくベイジアン手法の制限を克服し、最大100,000変数のデータセットに対しても計算スケーラビリティを確保すること。
  • 固定次元および発散次元の両方において、オラクル性および選択的一致性といった理論的性質を確立すること。
  • 事前グラフが誤って指定された場合でも、高い予測精度と低い偽陽性率を維持する、頑健な性能を示すこと。

提案手法

  • 回帰係数にラプラス事前分布を適用し、スクリーニングパrameterにグラフ構造を反映したロジスティック正規事前分布を導入したハイパーパrameterを設定する。
  • スクリーニングパrameterの逆共分散行列をグラフラプラシアンとしてモデル化し、接続された変数のスクリーニングを平滑化し、非接続の変数同士に条件付き独立性を実現する。
  • EMアルゴリズムにより逆共分散行列を欠損データとして扱い、観測データの周辺化を実行することで、閉形式の後部確率を得て、計算を効率化する。
  • 高次元設定における計算効率を高めるために、動的重み付きlasso技術を統合する。
  • 従来の適応的lassoとは異なり、初期重みに依存せず、MCMCベースの代替手法よりも計算が高速である。
  • 一般仮定の下で理論的性質を確立し、真のグラフが誤って指定された場合でさえも、オラクル性および選択的一致性を示す。

実験結果

リサーチクエスチョン

  • RQ1p ~ 100,000 の高次元回帰において、グラフ構造の事前情報が効果的に組み込まれるベイジアン変数選択手法は可能か?
  • RQ2提案手法は、従来の頻度的およびベイジアン手法と比較して、高次元設定においてより優れた予測性能および変数選択性能を達成できるか?
  • RQ3変数数が標本サイズを上回る状況で、かつグラフが誤って指定された場合でも、計算スケーラビリティと理論的一致性を維持できるか?
  • RQ4実世界のゲノミクスデータにおいて、グラフ情報の統合は偽陽性率と生物学的解釈可能性にどのように影響を与えるか?
  • RQ5グラフ正則化付きハイパーパラメータによる適応的スクリーニングは、標準的手法と比較して推定精度をどの程度向上させるか?

主な発見

  • シミュレーションでは、提案手法EMSHSが最小の交差検証平均二乗予測誤差(CV MSPE = 0.975)を達成し、チューニングパラメータごとにわずか17.0秒で計算が完了するなど、最も計算効率が高かった。
  • EMSHSは、予測精度と計算速度の両面でEMVSおよびEMVSSを上回り、それぞれCV MSPEが0.975、0.996、0.982であった。
  • TCGAのがんゲノミクス応用では、100回のランダムスプリットにおいて21個の遺伝子が少なくとも1回選択され、特にTOM1L1、RANBP17、BRD7が最も頻繁に選択された。
  • 選択された遺伝子群にはWntシグナル伝達経路が有意に豊富に含まれており、TOM1L1、RANBP17、BRD7の推定係数はそれぞれ-0.146、0.181、0.193であり、がんにおける既知の役割と整合的であった。
  • シミュレーションの1、2、5の状況において、EMSHSはEMSHより偽陽性率が低く、グラフ情報が正しく組み込まれた場合に特異的性能が向上した。
  • 理論的結果により、真のグラフが誤って指定された場合でさえも、固定次元および増大次元の両方において選択的一致性およびオラクル性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。