[論文レビュー] Constructing confidence sets after lasso selection by randomized estimator augmentation
本稿では、lasso選択後の有効な同時信頼集合を構築するための新規手法を提案する。この手法は、ランダム化推定量補完と、lassoのアクティブ集合を条件とする応答変数の条件付き分布からのマルコフ連鎖モンテカルロ(MCMC)サンプリングを用いる。推定量の平均ベクトルに対するランダム化を組み込むことで、保証された被覆率を満たしつつ、高精度で低体積の信頼集合が得られ、最先端の手法に比べて被覆率と効率性の両面で優れている。
Although a few methods have been developed recently for building confidence intervals after model selection, how to construct confidence sets for joint post-selection inference is still an open question. In this paper, we develop a new method to construct confidence sets after lasso variable selection, with strong numerical support for its accuracy and effectiveness. A key component of our method is to sample from the conditional distribution of the response $y$ given the lasso active set, which, in general, is very challenging due to the tiny probability of the conditioning event. We overcome this technical difficulty by using estimator augmentation to simulate from this conditional distribution via Markov chain Monte Carlo given any estimate $ ildeμ$ of the mean $μ_0$ of $y$. We then incorporate a randomization step for the estimate $ ildeμ$ in our sampling procedure, which may be interpreted as simulating from a posterior predictive distribution by averaging over the uncertainty in $μ_0$. Our Monte Carlo samples offer great flexibility in the construction of confidence sets for multiple parameters. Extensive numerical results show that our method is able to construct confidence sets with the desired coverage rate and, moreover, that the diameter and volume of our confidence sets are substantially smaller in comparison with a state-of-the-art method.
研究の動機と目的
- データ駆動型のlassoモデル選択後の複数パラメータに対する同時信頼集合を構築するという未解決問題に対処すること。
- 高次元において非常に低い確率を持つ、lassoアクティブ集合を条件とする応答変数の条件付き分布からのサンプリングという計算上の課題を克服すること。
- 有効な被覆率を維持しながら信頼集合の体積を最小化する、柔軟でスケーラブルな後選択推論フレームワークを構築すること。
- 個々のパラメータ推論にとどまらず、選択された変数の任意の部分集合に対する同時推論へと拡張すること。
- 推定量の平均推定値の不確実性をランダム化することで、Leeら(2016)のような既存手法と比較して数値的安定性と効率性を向上させること。
提案手法
- 推定量補完を用いて、応答変数 $ y $ のlassoアクティブ集合 $ A $ を条件とする条件付き分布からのシミュレーションを実現し、複雑な制約下でのMCMCサンプリングを可能にする。
- 2段階のMCMC手順を採用:まず、固定された推定値 $ ilde{ u} $ を条件とする $ y $ の条件付き分布からサンプリングし、次に $ ilde{ u} $ をランダム化することで、事後予測分布の近似を得る。
- 推定平均 $ ilde{ u} $ に対するランダム化ステップを導入することで、$ u_0 $ の不確実性を平均化でき、ロバストネスと被覆率の向上が可能になる。
- 関連するパラメータの任意の部分集合 $ u_B $ に対して柔軟な推論が可能なように、同時条件付き分布からのモンテカルロサンプルを活用して信頼集合を構築する。
- lassoアクティブ集合と変数選択のしきい値によって生じる多面体的制約を尊重するように設計された提案を用いたメトロポリス・ハスティングス法を用いる。
- MCMC中における変数アクティブ集合の変化に対応するため、係数に対して切断正規分布の提案を用い、アクティブ集合 $ ilde{eta}_j $ を動的に再構成する。
実験結果
リサーチクエスチョン
- RQ1データ駆動型かつ高次元なlasso選択後の、有効な同時信頼集合を構築することは可能か?
- RQ2高次元において非常に低い確率を持つ、lassoアクティブ集合を条件とする $ y $ の条件付き分布からの効率的サンプリングはどのように実現できるか?
- RQ3ランダム化推定量補完は、既存手法と比較して、後選択推論の数値的安定性と効率性を向上させることができるか?
- RQ4提案手法は、Leeら(2016)のような最先端の手法と比較して、より良い被覆率とより小さい体積の信頼集合を提供するか?
- RQ5本手法は、グループ構造やlasso以外の選択手順に対しても一般化可能か?
主な発見
- 提案手法は、$ p > n $ の高次元設定においても、名目上の被覆率を達成している。
- 数値的結果から、信頼集合の直径および体積がLeeら(2016)が生成するものと比べて顕著に小さく、精度の向上が示された。
- 真のモデルでない選択モデルであっても、アクティブ集合のみに条件付けているため、有効な被覆率を維持している。
- 推定平均 $ ilde{ u} $ に対するランダム化は、数値的安定性を著しく向上させ、信頼集合推定値の分散を低減した。
- MCMCサンプラーは、アクティブ集合を動的に調整し、切断提案を用いることで、条件付き分布の複雑で不規則なサポートを効果的に探索できた。
- 本手法は、$ B \neq \text{all} $ の任意の部分集合へ自然に一般化可能であり、同時個別区間の過剰に保守的な家族誤差率制御を回避できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。