Skip to main content
QUICK REVIEW

[論文レビュー] Model Prior Distribution for Variable Selection in Linear Regression Models

J Lee, Lee, Jeong Eun|arXiv (Cornell University)|Dec 26, 2015
Statistical Methods and Bayesian Inference参考文献 30被引用数 3
ひとこと要約

本稿は、線形回帰におけるベイズ変数選択のための、Kullback–Leibler 散発に基づく損失を用いてモデルの価値を定量化する、新しい目的的モデル事前分布を提案する。非情報的設定下のシミュレーション研究において、一様分布およびScott & Berger事前分布を上回る性能を示し、特にモデルサイズの正確な推定と事後頻度的性能の向上において優れている。

ABSTRACT

In this work we discuss a novel model prior probability for variable selection in linear regression. The idea is to determine the prior mass in an objective sense, by considering the worth of each of the possible regression models, given the number of covariates under consideration. Through a simulation study, we show that the proposed prior outperforms the uniform prior and the Scott \& Berger prior in a scenario of no prior knowledge about the size of the true regression models. We illustrate the use of the prior using two well-known data sets with, respectively, 15 and 4 covariates.

研究の動機と目的

  • 回帰モデルの相対的価値を主観的仮定に依存せずに反映する、目的的でデータ駆動のモデル事前分布を構築すること。
  • 真のモデルサイズについての事前知識が全くない状況において、一様分布およびScott & Berger事前分布の限界を是正すること。
  • 原理的損失ベースのアプローチを通じて、事後モデルサイズ推定の頻度的性能を向上させること。
  • 高次元変数選択における既存のモデル事前分布に対する、最小限の情報性でありながら統計的に整合性のある代替案を提供すること。

提案手法

  • 提案された事前分布は、競合するモデル間のKullback–Leibler (KL) 散発に基づいてモデルの確率を割り当てる。
  • モデルの価値は、モデルとその他の代替モデルとの間のKL散発を最小化することで定量化され、より低い散発はより高いモデル価値を示す。
  • この事前分布は、モデルサイズ(説明変数の数)に依存するように構築されており、モデル空間の複雑さに適応する。
  • 標本分布下での期待KL散発を用いて、予測適合度が低いモデルをペナルティとする事前分布を導出する。
  • シミュレーションおよび実データ解析を通じて、一様分布およびScott & Berger事前分布と比較し、事後モデルサイズ性能に注目する。
  • このアプローチは、観測データを用いて真のモデルに関する事前不確実性を更新することで事後分布を導出するベイズ枠組みに統合される。

実験結果

リサーチクエスチョン

  • RQ1主観的仮定に依存せずに、回帰モデルの相対的価値を反映する、目的的なモデル事前分布をどのように構築できるか?
  • RQ2損失ベースのモデル事前分布は、一様分布およびScott & Berger事前分布と比較して、モデルサイズ推定における頻度的性能を向上させるか?
  • RQ3真のモデルサイズについての事前情報が全くない状況において、提案された事前分布は真のモデルをよりよく同定できるか?
  • RQ4米国犯罪データおよびHaldデータセットなど、既知の構造を持つ実世界のデータセットにおいて、提案された事前分布はどのように性能を発揮するか?
  • RQ5モデルの複雑さ(説明変数の数)は、提案された事前分布の性能にどのような影響を与えるか?

主な発見

  • シミュレーション研究において、提案された損失ベースのモデル事前分布は、一様事前分布に比べて、事後モデルサイズ推定の頻度的精度が顕著に優れている。
  • 特に真のモデルサイズについての事前知識が全くない状況において、Scott & Berger事前分布と比較して、提案された事前分布は優れた性能を示す。
  • シミュレーションでは、提案された事前分布下でのモデルサイズの事後分布が、他の事前分布と比較して真のモデルサイズの周囲に集中している。
  • 米国犯罪データセット(15個の説明変数)において、提案された事前分布は、ベンチマーク事前分布よりもより単純で安定したモデルを同定した。
  • Haldデータセット(4個の説明変数)において、提案された事前分布は、既知の回帰構造とより整合性があり、予測性能も向上した事後モデル分布を生成した。
  • この手法がモデルサイズに依存するため、過剰に複雑なモデルを自然にペナルティ化しつつ、真の信号に感度を保つことができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。