Skip to main content
QUICK REVIEW

[論文レビュー] BayesVarSel: Bayesian Testing, Variable Selection and model averaging in Linear Models using R

Gonzalo García‐Donato, Anabel Forte|arXiv (Cornell University)|Nov 24, 2016
Statistical Mechanics and Entropy参考文献 3被引用数 4
ひとこと要約

この論文は、線形モデルにおける目的的ベイズ仮説検定、変数選択、モデル平均化を実行するためのBayesVarSel Rパッケージを紹介する。後方モデル確率の計算に正確かつヒューリスティックなアルゴリズムを提供し、基準に基づく事前分布を用いたモデル平均化推定および予測を可能にし、応用研究分野での広範な利用を想定した、Rのlm関数を模した直感的なインターフェースを備えている。

ABSTRACT

This paper introduces the R package BayesVarSel which implements objective Bayesian methodology for hypothesis testing and variable selection in linear models. The package computes posterior probabilities of the competing hypotheses/models and provides a suite of tools, specifically proposed in the literature, to properly summarize the results. Additionally, \ourpack\ is armed with functions to compute several types of model averaging estimations and predictions with weights given by the posterior probabilities. BayesVarSel contains exact algorithms to perform fast computations in problems of small to moderate size and heuristic sampling methods to solve large problems. The software is intended to appeal to a broad spectrum of users, so the interface has been carefully designed to be highly intuititive and is inspired by the well-known lm function. The issue of prior inputs is carefully addressed. In the default usage (fully automatic for the user)BayesVarSel implements the criteria-based priors proposed by Bayarri et al (2012), but the advanced user has the possibility of using several other popular priors in the literature. The package is available through the Comprehensive R Archive Network, CRAN. We illustrate the use of BayesVarSel with several data examples.

研究の動機と目的

  • 線形モデルにおける目的的ベイズ推論のための使いやすいRパッケージを開発すること。変数選択と仮説検定を対象とする。
  • 小規模から中規模の問題において、後方確率を効率的に計算するための正確かつヒューリスティックな計算手法を実装すること。
  • 後方モデル重みを用いたモデル平均化を支援し、モデルの不確実性を考慮した頑健な推定と予測を可能にすること。
  • 標準的なlm関数を模した直感的なインターフェースを提供し、応用研究者にとってベイズ法を容易に利用できるようにすること。
  • 事前分布の選択を扱うために、基準に基づく目的的事前分布を組み込みつつ、上級ユーザーが代替の事前分布を指定できるようにすること。

提案手法

  • 基準に基づく事前分布(例:Bayarri et al., 2012)を用いた目的的ベイズ手法を採用し、自動的かつ非情報的(非主観的)な事前分布の指定を保証する。
  • 中規模の問題において、後方モデル確率の高速計算を実現する正確なアルゴリズムを用いる。
  • 正確な計算が不可能な大規模な問題に対しては、ヒューリスティックなサンプリング手法(例:MCMC)を適用する。
  • 後方モデル確率を用いたモデル平均化を実装し、モデルの不確実性を考慮した推定と予測を可能にする。
  • Btest(ベイズ検定用)、BMAcoeff(モデル平均化係数推定用)、predictBvs(予測シミュレーション用)などの関数を提供する。
  • モデル平均化における予測分布には多変量スルーティング分布を用い、モデルとパラメータ推定の両方の不確実性を統合する。

実験結果

リサーチクエスチョン

  • RQ1線形モデルにおける変数選択と仮説検定に、目的的ベイズ手法をどのように効率的に実装できるか。
  • RQ2正確かつヒューリスティックなアルゴリズムが、さまざまな問題サイズにおいて後方モデル確率をどのように計算するかの性能はいかがなものか。
  • RQ3モデルの不確実性が存在する状況で、モデル平均化が推定と予測の精度をどのように向上させるか。
  • RQ4基準に基づく事前分布が、主観的入力を一切不要にしながら、自動的かつ客観的な推論をどのように保証するか。
  • RQ5ベイズパッケージのインターフェースを、非専門家ユーザーにとって直感的かつ利用しやすいものに設計するにはどうすればよいか。

主な発見

  • ラットの体重増加例では、H0の後方確率が0.554、H1が0.446であり、高たんぱく質食が平均体重増加に与える影響について強い証拠はないことが示された。
  • 貯蓄データセットでは、H1(完全モデル)の後方確率が0.954であった。これは、すべての予測変数(dpi、ddpi、pop15、pop75)が応答変数srを説明する強力な証拠があることを示している。
  • 貯蓄データセットで複数のモデルを比較した場合、H1の後方確率は0.925、H2(pop15を除く)は0.031であった。これにより、pop15はモデルに有意義に寄与していることが示された。
  • SDMデータセットでは、P60の包含確率が0.77であり、その効果が1を超える確率は、モデル平均化を用いて0.7511と推定された。
  • predictBvsを用いた予測シミュレーションでは、単峰性の予測分布が得られ、平均予測変数値の予測のヒストограмは明確な中心傾向を示した。
  • このパッケージは、複数の仮説を含む複雑なモデル比較タスクを効果的に処理でき、高次元設定下でも信頼性が高く、解釈可能な要約を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。