Skip to main content
QUICK REVIEW

[論文レビュー] Projection Predictive Inference for Generalized Linear and Additive Multilevel Models

Alejandro Catalina, Paul‐Christian Bürkner|arXiv (Cornell University)|Oct 14, 2020
Bayesian Modeling and Causal Inference参考文献 39被引用数 21
ひとこと要約

この論文は、一般化線形および加法的多層モデル(GLMMおよびGAMM)への投影予測的推論の拡張を試み、予測性能に基づく逐次的前向き選択によって、完全な参照モデルの後部分布を低次元の部分モデルに投影することで、頑健な変数および構造選択を可能にする。この手法は、予測性能に近い最適性を達成し、項の数を最大60%まで削減可能であり、高い頻度的性質と安定性を示しており、高い相関関係や複雑なグループ構造下でも有効である。

ABSTRACT

Projection predictive inference is a decision theoretic Bayesian approach that decouples model estimation from decision making. Given a reference model previously built including all variables present in the data, projection predictive inference projects its posterior onto a constrained space of a subset of variables. Variable selection is then performed by sequentially adding relevant variables until predictive performance is satisfactory. Previously, projection predictive inference has been demonstrated only for generalized linear models (GLMs) and Gaussian processes (GPs) where it showed superior performance to competing variable selection procedures. In this work, we extend projection predictive inference to support variable and structure selection for generalized linear multilevel models (GLMMs) and generalized additive multilevel models (GAMMs). Our simulative and real-word experiments demonstrate that our method can drastically reduce the model complexity required to reach reference predictive performance and achieve good frequency properties.

研究の動機と目的

  • 一般化線形および加法的多層モデル(GLMMおよびGAMM)における信頼性の高い変数および構造選択手法の不足に対処すること。
  • 従来GLMおよびGPに限定されていた投影予測的推論を、多層および加法的構造をサポートするように拡張すること。
  • 非正規分布および階層的モデルにおける同定可能性と計算の可能性を保証すること。
  • 広範なシミュレーションと実世界のデータ実験を通じて、手法の性能を検証すること。
  • より広範なアクセスを可能とするために、オープンソースのprojpred Rパッケージへの実装を図ること。

提案手法

  • 投影されたモデルの周辺尤度に対するラプラス近似を用いて、GLMMおよびGAMMへの投影予測的推論を適応化する。
  • 予測分布の参考モデルからのカルバック・ライブララー距離を最も小さくする変数を逐次的に追加する前向き探索戦略を採用する。
  • 除外された変数の係数をゼロに固定する制約付き部分空間に、完全な参照モデルの後部分布を投影し、除外された成分からの不確実性を保持する。
  • モデル推定と変数選択を分離する意思決定理論的枠組みを採用し、予測的一致性を確保する。
  • 予測性能の評価および変数の含め方をガイドする主な基準として、期待対数予測密度(ELPD)を用いる。
  • 特に相関が高い場合やデータがスパースな場合に安定するように、固定効果およびランダム効果にハイパーパラメータを導入して正則化を実施する。

実験結果

リサーチクエスチョン

  • RQ1同定可能性の問題が直接適用を妨げていた非正規分布・階層的モデルにおいて、投影予測的推論をGLMMおよびGAMMに一般化できるか?
  • RQ2相関やグループ構造の複雑さが変動する状況下で、多層および加法的モデルにおける関連変数および構造の選択性能はどの程度高いか?
  • RQ3完全な参照モデルの予測性能に一致させるために必要な投影モデルの最適なサイズは何か?
  • RQ4高い相関関係や多数のグループ要因がある状況下で、真正に関連する効果を特定する際の真陽性率と偽陽性率はどの程度か?
  • RQ5スパースまたは高い相関関係を持つ設計を含む多様なデータ構造において、この手法がどの程度の頑健性と安定性を維持できるか?

主な発見

  • 平均して、参照モデルの予測性能(ELPDで測定)を達成しながら、項の数を最大60%まで削減可能であり、モデルの複雑さが顕著に低減されている。
  • 予測変数間の相関が高くなるほど、最適な投影サイズが小さくなる傾向を示しており、相関が高い状況下でより高い選択効率を示している。
  • すべてのシミュレーション条件下で平均性能推定値の95%信用区間が狭く保たれていることから、高い頑健性が裏付けられている。
  • グループ要因の数が多くなったり相関が高くなるほど偽陽性率が上昇するが、相関が0.9であっても、真正に関連する効果の約半数を同定している。
  • 手法は強い頻度的性質を示しており、多様なデータ構成において、選択された部分モデルの予測性能が常に完全な参照モデルに近い水準を維持している。
  • ラプラス近似を用いることで、ランダム効果および加法的スムーズ項の取り扱いが効果的に実施され、複雑なモデルにおいても安定的かつ同定可能な投影が可能になっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。