Skip to main content
QUICK REVIEW

[論文レビュー] Post-selection inference for L1-penalized likelihood models

Jonathan Taylor, Robert Tibshirani|arXiv (Cornell University)|Feb 24, 2016
Statistical Methods and Inference被引用数 3
ひとこと要約

本稿では、一般化線形モデル、コックス回帰、グラフィカルラッソを含むℓ₁正則化尤度モデルに対する後選択推論手法を提案する。1ステップニュートン・ラプソン推定量を導入することで、MCMCサンプリングを回避し、先行研究で見られる2次余項の問題を改善しつつ、ラッソ選択を条件とした漸近的に有効なp値および信頼区間を提供する。

ABSTRACT

We present a new method for post-selection inference for L1 (lasso)-penalized likelihood models, including generalized regression models. Our approach generalizes the post-selection framework presented in Lee et al (2014). The method provides p-values and confidence intervals that are asymptotically valid, conditional on the inherent selection done by the lasso. We present applications of this work to (regularized) logistic regression, Cox's proportional hazards model and the graphical lasso.

研究の動機と目的

  • ℓ₁正則化尤度モデルを用いたモデル選択後の有効な統計的推論手法の開発。
  • ガウス回帰からの後選択推論フレームワークを一般化線形モデルおよび生存モデルへ拡張すること。
  • MCMCベースの推論に対する計算効率的で閉形式の代替手法の提供。
  • 先行手法で影響を受ける2次余項の制限を解消すること。
  • ラッソが引き起こす選択バイアスを考慮しつつ、選択された係数に関する推論を可能にすること。

提案手法

  • ラッソフィッティング後の選択モデルに1ステップニュートン・ラプソン推定量を適用し、これは後ラッソMLEと漸近的に同等である。
  • ラッソのアクティブ集合を条件とした選択的推論フレームワークを用い、ガウス設定における切断限界の導出に多面体補題を活用する。
  • 選択モデルにおける適切なスコア関数およびフィッシャー情報量を導出することで、一般化線形モデルへの適用を実現する。
  • 部分尤度と選択モデルにおけるスコアおよび情報行列の推定を用いて、コックス比例ハザードモデルへの適応を図る。
  • 精密行列に対するℓ₁正則化下での尤度関数のヘッシアンを導出し、グラフィカルラッソへの拡張を実現する。
  • 選択イベントを条件とした分布に基づく推論戦略を採用し、検定統計量の分布を制限することで、漸近的有効性を保証する。

実験結果

リサーチクエスチョン

  • RQ1ガウス線形モデルからℓ₁正則化尤度モデル(例:ロジスティック回帰やコックス回帰)への後選択推論の信頼性ある拡張は可能か?
  • RQ2MCMCサンプリングに依存せずに、ラッソ選択後の有効なp値および信頼区間をどのように構築できるか?
  • RQ3後選択推論における2次余項の影響は何か? そして、その影響をどのように軽減できるか?
  • RQ41ステップ推定量は、グラフィカルラッソのような非ガウスモデルに対しても漸近的に有効な推論を提供できるか?
  • RQ5ノイズ予測子が追加された場合、本手法はどのように動作するか? また、そのような状況下でナーブな推論と比較してどう異なるか?

主な発見

  • 提案された1ステップ推定量は、ロジスティック回帰やコックスモデルを含むℓ₁正則化モデルに対して、漸近的に有効なp値および信頼区間を提供する。
  • 南アフリカ心疾患データにおいて、ノイズ予測子を追加した場合、ナーブなp値は調整済みp値よりも顕著に小さく、本手法は適切に第1種過誤を制御していた。
  • タンパク質シグナル伝達データでは、1つの有意な相互作用(Mek-P38)がp値0.005で特定され、他の相互作用は有意でなかった。これは、選択的推論の正確性を示している。
  • 本手法はMCMCサンプリングを回避し、閉形式で推論を計算可能であり、TianとTaylor(2015)のような先行手法に比べて計算効率が優れている。
  • 本手法は高次元設定に対しても頑健であり、予測変数の数が標本サイズを上回る場合でも、シミュレーションおよび実データ応用を通じて正しい被覆率を維持している。
  • 本手法はCRAN上の公開Rパッケージ selectiveInference として実装されており、心用研究における再現可能性と利用可能性を高めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。