Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Approximations of Marginal Posteriors in Variable Selection

Willem van den Boom, Galen Reeves|arXiv (Cornell University)|Jun 22, 2015
Bayesian Methods and Mixture Models参考文献 25被引用数 7
ひとこと要約

本稿では、スパイクアンドスラブ事前分布を用いた高次元ベイズ変数選択におけるマージナル後確信度包含確率の効率的近似を実現するスケーラブルなフレームワークを提案する。この手法は、近似メッセージパッシング(AMP)とベイジアン圧縮回帰(BCR)を用い、回転されたデータの後確信度予測分布を近似することで、神経画像解析のような大規模な設定においても信頼性のある不確実性評価を可能にする。変数の有意性の正確で高速な推定が可能となり、科学的推論に不可欠である。

ABSTRACT

In many contexts, there is interest in selecting the most important variables from a very large collection, commonly referred to as support recovery or variable, feature or subset selection. There is an enormous literature proposing a rich variety of algorithms. In scientific applications, it is of crucial importance to quantify uncertainty in variable selection, providing measures of statistical significance for each variable. The overwhelming majority of algorithms fail to produce such measures. This has led to a focus in the scientific literature on independent screening methods, which examine each variable in isolation, obtaining p-values measuring the significance of marginal associations. Bayesian methods provide an alternative, with marginal inclusion probabilities used in place of p-values. Bayesian variable selection has advantages, but is impractical computationally beyond small problems. In this article, we show that approximate message passing (AMP) and Bayesian compressed regression (BCR) can be used to rapidly obtain accurate approximations to marginal inclusion probabilities in high-dimensional variable selection. Theoretical support is provided, simulation studies are conducted to assess performance, and the method is applied to a study relating brain networks to creative reasoning.

研究の動機と目的

  • 高次元変数選択において不確実性評価が不足している問題に対処する。多くの高速手法は統計的有意性の指標を提供できない。
  • 大規模問題(例:p > 1000)におけるMCMCを用いた正確なベイズ変数選択の計算不能性を克服する。
  • 非ガウス型事前分布を有するベイジアン線形回帰におけるマージナル後確率分布の近似に一般化可能でスケーラブルなフレームワークを開発する。
  • 各予測子の正確な後確信度包含確率(PIP)を提供し、科学的推論におけるp値のベイジアン版として機能させる。
  • 複雑で重たい尾を持つ、また病的条件の悪い特徴を有するシミュレートデータおよび実際の神経画像データにおいて、本手法の頑健性と正確性を実証する。

提案手法

  • 関心の対象となるパラメータをノイズ係数から分離するための回転に基づく変換を用い、高次元後確率をスカラー問題に簡略化する。
  • 最新の手法であるAMPおよびBCRを用いて、回転されたデータの後確信度予測分布を近似する。
  • 変数の包含をモデル化するため、スパイクアンドスラブ事前分布を適用する。各係数はゼロ(スパイク)または正規分布に従う(スラブ)。
  • 近似された後確信度予測密度を用いて、包含と非包含の下でのモデル証拠の比から、マージナル後確信度包含確率を推定する。
  • 誤差分散σ²と包含確率λが未知の場合、それらを経験的ベイズ法または階層的事前分布を用いて周辺化する。
  • pが大きい場合の後確信度予測近似の漸近的ガウス性に着目し、全後確率が非ガウス型であっても有効である。

実験結果

リサーチクエスチョン

  • RQ1AMPおよびBCRは、高次元ベイズ変数選択におけるマージナル後確信度包含確率に対して、正確でスケーラブルな近似を提供できるか?
  • RQ2シミュレーション設定において、相関構造(ρ)や信号対雑音比(SNR)が変化する条件下で、これらの近似はどの程度の性能を示すか?
  • RQ3σ²およびλが未知であり、データから推定されなければならない場合でも、本フレームワークはPIPを信頼性高く推定できるか?
  • RQ4正確なMCMCと比較して、これらの近似は正確性および計算効率の点でどの程度優れているか?
  • RQ5重たい尾を持つ、離散的で病的条件の悪い特徴を有する実際の神経画像データにおいて、本手法は生物学的に意味のある脳ネットワーク接続を同定できるか?

主な発見

  • AMPおよびBCRは、高相関(ρ = 0.8)や低SNR(SNR = 1)を含む多様なシミュレーション設定において、後確信度包含確率の非常に正確な近似を達成した。
  • MCMCに基づくベイズ変数選択と比較して、順序数のオーダーで高速化されながらも、PIP推定の正確性は同等を維持した。
  • AMPおよびBCRの両方が、σ²およびλが未知の場合でもPIPを的確に推定できた。200回のシミュレーションにおけるボックスプロットから、一貫性があり意味のある推定値が得られた。
  • 実際の脳結合研究(n=113, p=1802)において、本手法は左右半球間の結合を高い確率で特定した。これは先行神経科学の知見と整合的であった。
  • BCRおよびAMPは類似したが異なるエッジの優先順位を示し、重たい尾を持つ、病的条件の悪いデータにもかかわらず、既知の結合パターン(例:ノード18Lから3R、18R、20Rへの結合)を回復した。
  • AMPは特に高相関下でPIPを0または1にやや強く押し上げる傾向を示したが、両手法とも安定しており、情報量に富んでいた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。