Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian variable selection in high dimensional problems without assumptions on prior model probabilities

James O. Berger, Gonzalo García‐Donato|arXiv (Cornell University)|Jul 11, 2016
Statistical Methods and Inference参考文献 16被引用数 5
ひとこと要約

本稿は、予測子の数 $ p $ が標本サイズ $ n $ を上回る高次元線形モデルにおける、従来の事前分布の正則化を用いた新たなベイジアン変数選択手法を提案する。事前モデル確率に関する仮定を必要とせず、標準的な $ g $-prior や $ g $-混合分布の拡張である正則化された従来事前分布を導入することで、$ p \gg n $ の状況下でも一貫性のあるモデル選択と真のモデルへの事後分布の集中を実現する。実験結果により、真の共変数を的確に特定し、誤った共変数を効果的に除外する優れた性能を示している。

ABSTRACT

We consider the problem of variable selection in linear models when $p$, the number of potential regressors, may exceed (and perhaps substantially) the sample size $n$ (which is possibly small).

研究の動機と目的

  • 高次元線形モデルにおけるベイジアン変数選択を、$ p \gg n $ であるという現代統計学の一般的な課題に取り組むこと。
  • 高次元状況では現実的でないことが多い等しい事前モデル確率の仮定を排除すること。
  • 標準的な $ g $-prior や $ g $-混合分布を $ p \gg n $ の状況に一般化する、正則化された従来事前分布のクラスを構築すること。
  • ややいなごろしの正則性条件のもとで、事後分布の一貫性と真のモデルへの適切な集中を保証すること。
  • 理論的根拠が明確で、計算的に実行可能であり、モデル選択の一貫性といった頻度主義的性質を維持するアプローチを提供すること。

提案手法

  • 従来事前分布の拡張として正則化された従来事前分布を導入し、$ \mathbf{V}_\gamma^T \mathbf{V}_\gamma $ の特異性を考慮して事前スケール行列 $ \mathbf{S}_\gamma $ を修正することで、$ p \gg n $ の状況に対応する。
  • グローバルスケールパラメータ $ t $ にわたる混合密度 $ p_n(t) $ を用いた階層的事前分布構造を採用し、$ n \leq k_\gamma $ の場合でも適切な事後推論を保証する。
  • モデル比較の主なツールとしてベイズ因子 $ B_\gamma = m_\gamma(\mathbf{y}) / m_0(\mathbf{y}) $ を用い、新しい事前分布のもとでの周辺尤度を計算する。
  • 予測一致基準を適用して事前分布構造を正当化し、再パラメトリゼーションに対して不変であり、予測的に帰無仮説モデルと一致するようにする。
  • モデル選択には事後モデル確率 $ f(\boldsymbol{\gamma} \mid \mathbf{y}) \propto B_\gamma f(\boldsymbol{\gamma}) $ を用い、$ f(\boldsymbol{\gamma}) $ を非情報的とすることでバイアスを回避する。
  • モデル空間を正則部分集合と特異部分集合に分解し、事後集中を分析することで、$ n $ が十分に大きいとき、事後質量が正則部分集合に集中することを示す。

実験結果

リサーチクエスチョン

  • RQ1高次元モデル $ p \gg n $ において、等しい事前モデル確率の仮定なしに、ベイジアン変数選択を一貫して行うことは可能か?
  • RQ2標準的な事前分布(例:$ g $-prior)をどのように $ p \gg n $ の状況に拡張すれば、望ましい理論的性質を保ちつつ対応できるか?
  • RQ3高次元線形モデルにおける $ n/p $ の比が、事後集中やモデル選択の正確さに与える影響は何か?
  • RQ4Lasso などの頻度主義的手法と比較して、提案手法の変数選択の正確さとスパarsity はどのように異なるか?
  • RQ5$ p $ が $ n $ よりも速く増加する場合でも、$ n \to \infty $ のとき事後分布は真のモデルに集中するか?

主な発見

  • $ n = 41 $、$ p = 8408 $、真の共変数が4つであるシミュレーションでは、特異モデル部分集合の事後確率はたった 0.004 にとどまり、正則モデル空間への強い事後集中を示している。
  • 2つの真の共変数 $ x_1 $ と $ x_3 $ はそれぞれ高い包含確率(0.809 と 0.726)を示したが、すべての誤った共変数の包含確率は 0.038 未満であった。
  • $ n = 10 $ のとき、特異部分集合の事後モデル確率は 0.995 に達し、データ情報が $ p \gg n $ の影響に圧倒されたが、$ n $ が 30 に増加すると 0.320 に低下し、データ情報の増大が顕著になった。
  • 最も高い事後確率を持つモデル(HPM)は $ \{x_1, x_3\} $ であり、真のモデルを正しく特定しており、混合密度の事前分布の選択にかかわらず一貫性を示した。
  • Lasso では $ \lambda_{\text{min}} $ では1〜38個の誤った変数が選択されたが、$ \lambda_{1\text{se}} $ では1〜13個に減少したものの、中央値モデルには $ x_2 $、$ x_{3780} $、$ x_{4494} $ が含まれており、不安定さが顕在した。これに対して、ベイジアン手法は安定的かつ正確な選択を示した。
  • 理論的一致性を維持している:$ n \to \infty $ のとき、真のモデルの事後確率は1に収束し、$ p $ が $ n $ より速く増加する場合でも同様である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。