Skip to main content
QUICK REVIEW

[論文レビュー] Methods and Tools for Bayesian Variable Selection and Model Averaging in Univariate Linear Regression

Anabel Forte, Gonzalo García‐Donato|arXiv (Cornell University)|Dec 7, 2016
Statistical Methods and Bayesian Inference参考文献 33被引用数 5
ひとこと要約

本稿は、単変量線形回帰におけるベイズ変数選択およびモデル平均化のための4つのRパッケージ—BMS、BayesVarSel、mombf、BayesFactor—を評価・比較する。すべてのパッケージが類似した結果をもたらす一方で、計算効率、事前分布の柔軟性、並列処理や収束診断といった機能の違いにより、小規模から中規模のサンプルサイズではBayesVarSelが最適であり、大規模データセットではBMSが好ましいことが示された。

ABSTRACT

In this paper we briefly review the main methodological aspects concerned with the application of the Bayesian approach to model choice and model averaging in the context of variable selection in regression models. This includes prior elicitation, summaries of the posterior distribution and computational strategies. We then examine and compare various publicly available { t R}-packages for its practical implementation summarizing and explaining the differences between packages and giving recommendations for applied users. We find that all packages reviewed lead to very similar results, but there are potentially important differences in flexibility and efficiency of the packages.

研究の動機と目的

  • ベイズ変数選択およびモデル平均化のための4つの公開Rパッケージの、パフォーマンス、柔軟性、使いやすさを評価・比較すること。
  • 特にジェフリーズ、ゼルナー、シオウの伝統的事前分布のような、従来の事前分布がモデル選択および推論に与える影響を評価すること。
  • 固定共変数、階層的モデリング、並列計算などの利用可能な機能を含め、計算効率、収束速度、および利用可能な機能に基づいて、実務研究者への実用的助言を提供すること。
  • MCMC、逆転ジャンプ、重要度サンプリングなどの数値実装戦略と、それらがCPU時間および事後モデル確率および包含確率の正確性に与える影響を検討すること。
  • ドキュメンテーションの質およびユーザーインターフェース設計を、パッケージ間で比較し、実務ユーザーがツールを選定する手がかりを提供すること。

提案手法

  • 本研究では、変数の包含を示すバイナリーベクトルでインデックス化されたモデルを用いて、周辺尤度と事後モデル確率に基づくベイズ変数選択をレビューおよび実装する。
  • 特にゼルナー=シオウおよびジェフリーズ型の事前分布を用い、これらは目的的で情報のない性質を示し、最適な頻度的リスク行動を示すことで知られている。
  • 4つのRパッケージ—BMS(ベイズモデルサンプリング)、BayesVarSel(ベイズ変数選択)、mombf(周辺尤度を用いたモデル選択)、BayesFactor(ベイズ仮説検定)—を比較し、それぞれが異なる計算戦略を採用している。
  • 収束速度および後退的包含確率(PIPs)の正確性を、ベンチマークデータセット(例:ボストン住宅価格およびGDP成長)を用いて計算効率を評価する。結果はバーンイン期間後を基準として評価される。
  • PIPsのパッケージ間の数値的比較および、固定共変数、主効果が交互作用より先に考慮される(主効果の優先)というヒエラルキーの原則の適用、収束診断の有無といった機能の評価が含まれる。
  • 再現性および実用的使いやすさに重点を置き、シミュレーションおよび実データを用いて、パッケージ間での結果の一貫性と頑健性をテストする。

実験結果

リサーチクエスチョン

  • RQ1BMS、BayesVarSel、mombf、BayesFactorという4つのRパッケージは、線形回帰におけるベイズ変数選択において、計算効率および収束速度の点でどのように比較されるか?
  • RQ2特に伝統的事前分布の違いが、パッケージ間で事後モデル確率および包含確率にどの程度の影響を与えるか?
  • RQ3小規模、中規模、大規模なサンプルサイズを持つユーザーにとって、柔軟性、使いやすさ、パフォーマンスのバランスが最も優れたパッケージはどれか?
  • RQ4固定共変数、階層的モデリング(主効果の優先)、並列計算といった機能が、実際のパッケージ選定にどのように影響を与えるか?
  • RQ5後退的包含確率(PIPs)は、パッケージ間でどの程度信頼できるか?また、合理的な計算時間内に類似した値に収束するか?

主な発見

  • 30分の計算後、4つのパッケージすべてが非常に類似した後退的包含確率(PIPs)を生成し、差は小数第二位までである。
  • 小規模から中規模のサンプルサイズでは、計算効率が高く収束が速いため、BayesVarSelが推奨される。特に $ n $ が小さい場合に顕著である。
  • 大規模データセットでは、スケーラビリティが高く、高次元のモデル空間を効率的に処理できるため、BMSが好ましい。
  • 特に $ p $ や $ n $ が大きい場合にスケーラビリティに劣るため、BayesFactorは一般用途には推奨されない。
  • mombfは伝統的なゼルナー=シオウ族とはわずかに異なる事前分布を使用しているが、BMS や BayesVarSel と同等のPIPs推定を素早く達成するが、わずかに高いばらつきを示す。
  • BMSは優れた収束診断機能とMCMC収束の監視ツールを提供する。一方、BayesVarSel と BMS は並列計算をサポートしており、マルチコアシステムでのパフォーマンス向上に寄与する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。