Skip to main content
QUICK REVIEW

[論文レビュー] Projection predictive variable selection using Stan+R

Juho Piironen, Aki Vehtari|arXiv (Cornell University)|Aug 11, 2015
Advanced Statistical Methods and Models参考文献 11被引用数 19
ひとこと要約

本論文では、ベイズ回帰モデルのフィッティングにStanを、変数選択にはRを用いた、線形ガウスモデルにおける射影予測変数選択の実用的実装を提示する。階層的収縮事前分布(例:$\nu=3$ のホーシューピル)を用いることで、わずか約5〜20の変数を用いても、フルモデルとほぼ同等の予測性能を達成し、MCMCサンプリングの安定性と、交差検証を用いた頑健な変数選択を両立していることが示された。

ABSTRACT

This document is additional material to our previous study comparing several strategies for variable subset selection. Our recommended approach was to fit the full model with all the candidate variables and best possible prior information, and perform the variable selection using the projection predictive framework. Here we give an example of performing such an analysis, using Stan for fitting the model, and R for the variable selection.

研究の動機と目的

  • StanとRを用いたスケーラブルで頑健なベイズ変数選択ワークフローの提示。
  • ホーシューピルのような重たい尾を持つ事前分布を用いたNUTSサンプリングの不安定性を、階層的収縮事前分布における自由度パラメータ($\nu$)の調整により解消すること。
  • 射影予測変数選択が、フルモデルの予測性能を保持する最小限の変数集合を信頼性高く同定できることを示すこと。
  • UCI Communities and Crimeデータセットを用いた実用的で再現可能な例の提供。交差検証とテストセット評価を併用。

提案手法

  • 回帰係数に階層的収縮事前分布(HS-$t_\nu$)を適用したフル線形ガウス回帰モデルを、Stanを用いてフィッティング。切片、グローバルスケール$\tau$、ノイズ分散$\sigma^2$に弱情報的事前分布を設定。
  • 局所スケールパrameter $\lambda_i$ とグローバルスケール$\tau$ に半スチューデント-t分布を適用。$\nu=3$ とすることで、発散遷移を低減しつつスパarsityを維持。
  • 射影予測変数選択を適用:サブモデルに変数を段階的に追加し、サブモデルとフルモデルの予測分布との間のKullback-Leibler発散を最小化する。
  • 前向き探索ヒューリスティクスを用いる:各ステップで、フルモデルの予測分布とのKL発散を最も大きく減少させる変数を選択。
  • 10分割交差検証とテストセット評価を用いて性能を評価。指標には平均対数予測密度(MLPD)と平均二乗誤差(MSE)。
  • Rを用いて後処理、変数の順位付け、サブモデルとフルモデルの性能比較を実施。

実験結果

リサーチクエスチョン

  • RQ1中程度の尾の重さ($\nu=3$)を持つ階層的収縮事前分布を用いることで、StanにおけるMCMCサンプリングの安定性が向上し、同時にホーシューピル事前分布が持つスパarsity誘導特性を損なわずに維持できるか。
  • RQ2射影予測変数選択が、変数の部分集合のみを用いても、フルモデルと同等の予測性能を回復できるか。
  • RQ3フルモデルと予測性能が区別できない最小の変数数は何か。
  • RQ4交差検証による性能推定値とテストセット性能の間にはどのような相関があるか。

主な発見

  • HS-$t_\nu$事前分布において$\nu=3$を用いることで、HS-$t_3$とHS-$t_3$+の両方で発散遷移率がそれぞれ0.0%と0.1%に低下した。これは$\nu=1$のときの3.4%および5.2%と比較して顕著な改善であり、予測性能に影響を与えることなく実現された。
  • フルモデルの予測能力は、約5つの変数でほぼ完全に再現可能であり、平均対数予測密度(MLPD)と平均二乗誤差(MSE)の差が最小限に抑えられている。
  • 20個の変数まで到達すると、サブモデルの予測性能は実用上、フルモデルと区別がつかない水準に達しており、MLPDおよびMSEの差はほぼゼロに近い。
  • 交差検証による性能推定値とテストセット性能がよく一致しており、このフレームワークにおいて交差検証がモデル選択に信頼性をもたらすことが裏付けられた。
  • 前向き探索ヒューリスティクスは、交差検証の各foldおよびテストデータにおいて一貫した結果を示し、最も関連性の高い変数を効果的に同定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。