Skip to main content
QUICK REVIEW

[論文レビュー] Learning from a lot: Empirical Bayes in high-dimensional prediction settings

Mark A. van de Wiel, Dennis E. te Beest|arXiv (Cornell University)|Sep 13, 2017
Statistical Methods and Bayesian Inference参考文献 59被引用数 3
ひとこと要約

本稿は、遺伝子発現経路やp値などの変数に関する事前情報(共通データ)を活用して、罰則付き回帰、線形判別分析、ベイズモデルにおけるチューニングパラメータ推定を改善する、高次元予測のための経験的ベイズ(EB)手法を提案する。理論的およびシミュレーション結果により、変数および共通データ全体にわたる強度の借用により、EBは交差検証や完全ベイズを上回る性能を示しており、平均二乗誤差および事後区間カバレッジの両面で改善が確認されている。

ABSTRACT

Empirical Bayes is a versatile approach to `learn from a lot' in two ways: first, from a large number of variables and second, from a potentially large amount of prior information, e.g. stored in public repositories. We review applications of a variety of empirical Bayes methods to several well-known model-based prediction methods including penalized regression, linear discriminant analysis, and Bayesian models with sparse or dense priors. We discuss `formal' empirical Bayes methods which maximize the marginal likelihood, but also more informal approaches based on other data summaries. We contrast empirical Bayes to cross-validation and full Bayes, and discuss hybrid approaches. To study the relation between the quality of an empirical Bayes estimator and $p$, the number of variables, we consider a simple empirical Bayes estimator in a linear model setting. We argue that empirical Bayes is particularly useful when the prior contains multiple parameters which model a priori information on variables, termed `co-data'. In particular, we present two novel examples that allow for co-data. First, a Bayesian spike-and-slab setting that facilitates inclusion of multiple co-data sources and types; second, a hybrid empirical Bayes-full Bayes ridge regression approach for estimation of the posterior predictive interval.

研究の動機と目的

  • 大規模データと事前情報(共通データ)を活用する経験的ベイズ手法を開発し、高次元予測設定において応用可能にする。
  • 罰則付き回帰、線形判別分析、ベイズモデルにおけるチューニングパラメータ推定を、共通データを用いて改善する。
  • 高次元および中次元設定において、経験的ベイズを交差検証および完全ベイズと比較する。
  • スパイクアンドスラブおよびリッジ回帰モデルに複数の共通データソースを統合する、新たなEBアプローチを提案する。
  • pの関数としての平均二乗誤差およびカバレッジ特性を理論的・実験的に評価する。

提案手法

  • 経験的ベイズにおけるハイパーパrameter推定に、周辺尤度の最大化を用い、事前分布パラメータを未知としてデータから推定する。
  • 罰則付き回帰(例:リッジ、ラッソ)、線形判別分析、共通データを用いたスパース/ドライフトリートメントベイズ事前分布にEBを適用する。
  • 局所的な事前分散の適応を可能にする、複数の共通データソースを統合したベイズ的スパイクアンドスラブモデルを導入する。
  • 事後予測区間推定のためのハイブリッド経験的ベイズ-完全ベイズリッジ回帰アプローチを提案する。
  • 独立同一分布正規事前分布を仮定する線形モデルにおいて、事前分散τ²のEB推定量の期待平均二乗誤差(EMSE)を導出する。
  • 設計行列の共分散に逆ウィシャート分布を仮定し、推定分散のモーメントを計算することで、解析的EMSE導出を可能にする。

実験結果

リサーチクエスチョン

  • RQ1p > n の高次元設定において、経験的ベイズは予測精度をどのように向上させるか?
  • RQ2p値や機能的アノテーションなどの共通データは、高次元モデルにおける経験的ベイズチューニングをどのように改善できるか?
  • RQ3平均二乗誤差および区間カバレッジの観点から、経験的ベイズは交差検証および完全ベイズと比較してどのように性能を示すか?
  • RQ4特に高次元および中次元設定において、事前分散の経験的ベイズ推定量の理論的挙動はpの関数としてどのように変化するか?
  • RQ5ハイブリッド経験的ベイズ-完全ベイズ手法は、リッジ回帰における事後予測区間推定をどのように改善できるか?

主な発見

  • 独立同一分布正規事前分布を仮定する線形モデルにおいて、事前分散τ²のEB推定量の期待平均二乗誤差(EMSE)を解析的に導出しており、p、n、τ²に依存することが示された。
  • 独立設計の場合、EMSEはn、p、τ²の関数に簡略化され、pが増加するにつれて推定精度が向上することが示され、高次元設定におけるより良い事前分布推定が可能であることが裏付けられた。
  • シミュレーション結果により、3成分ガウス混合事前分布を用いたEBは、単一のガウス事前分布よりも、特に異質な設定において優れた事後区間カバレッジを達成した。
  • ハイブリッドEB-完全ベイズ手法は、純粋なEBや完全ベイズよりも、p ≈ 100–200 の中次元設定において、95%事後予測区間のカバレッジをより良くした。
  • スパイクアンドスラブモデルにおける共通データの活用により、局所的な事前分布の適応が可能となり、高次元ゲノム応用における変数選択および予測精度が向上した。
  • 共通情報が利用可能な状況では、推定の安定性および平均二乗誤差の観点から、経験的ベイズは交差検証を常に上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。