Skip to main content
QUICK REVIEW

[논문 리뷰] Comparison of prediction errors: Adaptive p-values after cross-validation

Jelena Markovic, Lucy Xia|arXiv (Cornell University)|2017. 03. 20.
Statistical Methods and Bayesian Inference참고 문헌 17인용 수 10
한 줄 요약

이 논문은 교차검증 라소 및 관련 절차를 통해 모형 선택 이후의 타당한 선택적 추론을 위한 프레임워크를 제안한다. 이는 점근적으로 Uniform(0,1) 분포를 따르는 피봇 통계량을 유도함으로써 이루어지며, 선택 통계량 또는 검정 통계량에 정규 랜덤화를 추가함으로써 표준 가정이 성립하지 않을 경우에도 점근적으로 타당한 가설 검정과 신뢰구간을 가능하게 한다. 시뮬레이션을 통해 검증된 바, 이는 높은 검정력과 FDR 제어를 보인다.

ABSTRACT

We develop tools to do valid post-selective inference for a family of model selection procedures, including choosing a model via cross-validated Lasso. The tools apply universally when the following random vectors are jointly asymptotically multivariate Gaussian: 1. the vector composed of scores for each model evaluated under certain model selection criteria (e.g. cross-validation errors across folds, AIC, prediction errors etc.); 2. the test statistics which we use to do inference on the parameter of interest chosen after looking at the selected model. Under these assumptions, we derive a pivotal quantity that has an asymptotically Unif(0,1) distribution which can be used to perform tests and construct confidence intervals. Both the tests and confidence intervals are selectively valid for the chosen parameter. While the above assumptions may not be satisfied in some applications, we propose a novel variation to these model selection procedures by adding Gaussian randomizations to either one of the two vectors. We illustrate our method through adding randomization and applying our technical tools to four important procedures for which no valid selective inference has yet developed: cross-validated Lasso, cross-validated randomized Lasso, AIC-based model selection among a fixed set of models and a population version of LOCO of Rinaldo et al (2016). We also develop MCMC sampling scheme to construct valid post-selective confidence intervals empirically in cases with randomized model selection procedures. Finally, as a side product, we demonstrate via simulation that, with the help of selection-adjusted p-values after cross-validated randomized Lasso, we can achieve high-statistical power and FDR control, yielding results comparable to knockoffs (in simulations favorable to knockoffs), and much better results than non-randomized Lasso.

연구 동기 및 목표

  • 교차검증 라소와 같은 모형 선택 절차 이후의 선택적 추론을 위한 일반적 프레임워크를 개발함으로써, 선택 편향으로 인해 기존 추론이 무효화되는 상황에서도 해결 가능하도록 한다.
  • 선택된 모형 조건 하에서 가설 검정과 신뢰구간이 유효하게 유지되도록 보장함으로써, 교차검증 오차와 같은 데이터 기반 기준에 기반한 선택 조건에서도 유효성을 확보한다.
  • 이전에 선택적 추론 방법이 없었던 AIC 기반 모형 선택 및 인구 수준의 LOCO와 같은 절차에 대해 타당한 추론 도구의 부족을 해결한다.
  • 선택 조정된 p-값을 도입함으로써 고차원 설정에서 검정력과 거짓 발견률(FDR) 제어를 향상시킨다.
  • 랜덤화된 절차에서 유효한 선택적 추론을 위한 실용적인 MCMC 기반 샘플링 기법을 제공한다.

제안 방법

  • 선택 점수(예: 교차검증 오차)와 검정 통계량의 공동 점근적 다변량 정규분포를 바탕으로 피봇 통계량을 유도하여, 귀무가설 하에서 Uniform(0,1) 분포를 따르도록 보장한다.
  • 원래의 가정이 성립하지 않을 경우 점근적 정규분포를 복원하기 위해 선택 통계량 또는 검정 통계량에 정규 랜덤화를 도입한다.
  • 선택된 모형 조건 하에서 유효한 p-값과 신뢰구간을 구성하기 위해 피봇 통계량을 기준 분포로 사용한다.
  • 모형 선택 과정에서 랜덤화가 포함된 경우, 선택적 추론을 위한 신뢰구간을 실증적으로 계산하기 위해 MCMC 샘플링 알고리즘을 개발한다.
  • 이 프레임워크를 네 가지 핵심 절차에 적용한다: 교차검증 라소, 교차검증 랜덤라이즈드 라소, AIC 기반 모형 선택, 인구 수준의 LOCO.
  • 시뮬레이션 연구를 통해 선택 조정된 p-값의 검정력과 FDR 제어 성능을 평가하며, 노크오프스와 비교한다.

실험 결과

연구 질문

  • RQ1교차검증 라소를 통한 모형 선택 이후, 선택 기준이 데이터 기반 기준에 의존하더라도 점근적으로 타당한 p-값과 신뢰구간을 구성할 수 있는가?
  • RQ2선택 통계량과 검정 통계량의 공동 점근적 정규분포 가정이 성립하지 않을 경우, 어떻게 선택적 추론의 타당성을 확보할 수 있는가?
  • RQ3고차원 모형 선택에서 정규 랜덤화가 선택적 추론의 타당성과 검정력에 어떤 영향을 미치는가?
  • RQ4랜덤라이즈드 라소에서 도출된 선택 조정된 p-값은 노크오프스 수준의 FDR 제어와 높은 검정력을 달성할 수 있는가?
  • RQ5모형 선택 과정에서 랜덤화가 포함된 경우, 어떻게 실증적으로 유효한 선택적 추론을 위한 신뢰구간을 계산할 수 있는가?

주요 결과

  • 제안된 피봇 통계량은 귀무가설 하에서 점근적으로 Uniform(0,1) 분포를 따르며, 이는 모형 선택 이후의 타당한 가설 검정을 가능하게 한다.
  • 정규 랜덤화를 통해 원래의 가정이 성립하지 않을 경우에도 점근적 정규분포를 복원하고, 이로 인해 타당한 추론이 가능해진다.
  • 이 방법은 이전에는 해결이 어려웠던 네 가지 절차에 대해 유효한 선택적 추론을 제공한다: 교차검증 라소, 교차검증 랜덤라이즈드 라소, AIC 기반 모형 선택, 인구 수준의 LOCO.
  • 시뮬레이션 결과에 따르면, 랜덤라이즈드 라소에서 도출된 선택 조정된 p-값은 높은 검정력과 FDR 제어를 보이며, 비랜덤라이즈드 라소와 비교해도 우수하거나 이를 초월한다. 또한 노크오프스와 비교해도 유리한 성능을 보인다.
  • MCMC 샘플링 기법을 통해 랜덤라이즈드 모형 선택 절차에서 유효한 선택적 추론을 위한 신뢰구간을 실증적으로 구성할 수 있다.
  • 이 프레임워크는 랜덤화가 타당성을 보장하는 데서만 아니라 고차원 설정에서 추론 성능을 향상시키는 데에도 활용될 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.