Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Bayesian SLOPE -- High-dimensional Model Selection with Missing Values

Wei Jiang, Małgorzata Bogdan|arXiv (Cornell University)|Sep 14, 2019
Statistical Methods and Bayesian Inference参考文献 32被引用数 5
ひとこと要約

本稿では、欠損共変数を伴う高次元線形モデルにおける、新たなベイジアン変数選択手法である適応的ベイジアンSLOPE(ABSLOPE)を提案する。SLOPEのFDR制御可能なソート済みl1正則化と、スパイクアンドスラブLASSOの階層的事前分布構造を組み合わせることで、確率的近似EMアルゴリズムを用いて同時に変数選択、パラメータ推定、欠損データ補完を実行可能となる。シミュレーションおよび実臨床データ(外傷データ)において、パワー、FDR制御、推定バイアスの観点で優れた性能を示した。

ABSTRACT

We consider the problem of variable selection in high-dimensional settings with missing observations among the covariates. To address this relatively understudied problem, we propose a new synergistic procedure -- adaptive Bayesian SLOPE -- which effectively combines the SLOPE method (sorted $l_1$ regularization) together with the Spike-and-Slab LASSO method. We position our approach within a Bayesian framework which allows for simultaneous variable selection and parameter estimation, despite the missing values. As with the Spike-and-Slab LASSO, the coefficients are regarded as arising from a hierarchical model consisting of two groups: (1) the spike for the inactive and (2) the slab for the active. However, instead of assigning independent spike priors for each covariate, here we deploy a joint "SLOPE" spike prior which takes into account the ordering of coefficient magnitudes in order to control for false discoveries. Through extensive simulations, we demonstrate satisfactory performance in terms of power, FDR and estimation bias under a wide range of scenarios. Finally, we analyze a real dataset consisting of patients from Paris hospitals who underwent a severe trauma, where we show excellent performance in predicting platelet levels. Our methodology has been implemented in C++ and wrapped into an R package ABSLOPE for public use.

研究の動機と目的

  • 共変数に部分的な欠損が存在する高次元変数選択の課題に取り組むこと。これは、既存手法でしばしば無視される状況である。
  • 変数選択、パラメータ推定、欠損データ補完を統合的に処理する包括的なベイジアンフレームワークを構築すること。
  • SLOPEのFDR制御特性と、スパイクアンドスラブLASSOの適応的スリッキングおよびスパarsity誘導性を統合し、選択精度と推定効率を向上させること。
  • 予測変数間の相関に対しても頑健であり、欠損値を伴う非直交設計下でもFDR制御を維持できることを保証すること。
  • SAEMおよびSLOBEアルゴリズムを用いた計算効率の高い実装を提供し、大規模データ環境における実用的応用を可能とすること。

提案手法

  • 回帰係数がスパイク(ゼロ)とスラブ(非ゼロ)の混合分布に従う階層的事前分布を提案。スパイク成分は、FDR制御を可能にするために、SLOPEのペナルティ構造を統合した。
  • 欠損共変数を潜在変数としてモデル化し、観察済み尤度にペナルティを加えた最尤推定を、確率的近似EM(SAEM)アルゴリズムで最大化。繰り返し、潜在変数のサンプリングとパrameterの更新を実行。
  • 補完ステップでは、包含指標γ、グローバルスリッキングパラメータc、ローカルスリッキングパラメータθを含む潜在変数を、階層モデルから導出された条件付き後確率分布に基づいてサンプリング。
  • 最適化ステップでは、観測済みデータと補完済み欠損値を含む完全データを用いて、β、σ²、μ、Σの最尤推定値(MLE)を計算。収束を保証するための適応的ステップサイズを導入。
  • SLOBEを導入。これは、完全なMCMCサンプリングを期待値に基づく補完に置き換える、ABSLOPEの高速近似手法であり、計算時間を著しく短縮しながらも、精度を維持。
  • 初期化にはリッジ回帰またはスパイクアンドスラブLASSOを用い、初期欠損値補完にはPCAまたは平均補完を適用することで収束性を向上。

実験結果

リサーチクエスチョン

  • RQ1欠損共変数を伴う高次元回帰において、ベイジアン変数選択手法が、誤り発見率(FDR)を効果的に制御できるか。
  • RQ2独立なスパイク事前分布と比較して、統合されたSLOPEスパイク事前分布は、欠損データ下でのFDR制御と推定バイアスの観点でどの程度優れているか。
  • RQ3信号強度、スパarsity、欠損メカニズムの変動が生じる多様なシミュレーション設定において、本手法がどの程度高いパワーと低い推定バイアスを維持できるか。
  • RQ4欠損データを伴う状況下で、LASSO、適応的LASSO、スパイクアンドスラブLASSOといった既存手法と比較して、変数選択の正確性と予測性能において、ABSLOPEはどの程度優れているか。
  • RQ5臨床外傷データのような、欠損値を伴う実世界の高次元データセットに対しても、本手法は効率的にスケーリング可能か。

主な発見

  • ABSLOPEは、すべてのシミュレーション設定において、予測変数間の高相関や欠損データメカニズムが存在する状況でも、強固なFDR制御を達成した。
  • 特に低信号強度および高相関設定下で、競合手法に比べて高いパワーと低い推定バイアスを示した。
  • 高速版SLOBEは、計算時間を最大50%短縮しながらも、同等の変数選択精度とFDR制御を維持した。
  • Traumabase応用において、ABSLOPEは欠損共変数が存在する中でも、高精度に血小板レベルを予測し、生物学的に意味のある予測変数を同定した。
  • 初期化およびハイパーパrameterの選択に対して頑健であり、θおよびcの異なる事前分布設定下でも結果が安定した。
  • RパッケージABSLOPEの実装により、欠損値を伴う高次元データセットの再現可能でスケーラブルな解析が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。