Skip to main content
QUICK REVIEW

[논문 리뷰] Bootstrap inference after using multiple queries for model selection

Jelena Markovic, Jonathan Taylor|arXiv (Cornell University)|2016. 12. 22.
Statistical Methods and Inference참고 문헌 23인용 수 12
한 줄 요약

이 논문은 비모수 설정에서 다중 쿼리 이후의 모형 선택 후 추론을 위한 부트스트랩 기반 추론 방법을 개발한다. 선택적 중심극한정리와 투영 랭귀언 몽테카를로 샘플링을 사용하며, 광범위한 분포 클래스에 대해 점점 더 중심적인 부트스트랩 통계량을 보장한다. 이는 Leeb와 Pötscher의 불가능성 결과를 해결하여, 데이터 캐빙과 다중 시각을 포함한 복잡한 선택 절차 이후에도 유효한 신뢰구간과 검정을 가능하게 한다.

ABSTRACT

In this work, we provide a refinement of the selective CLT result of Tian and Taylor (2015), which allows for selective inference in non-parametric settings by adjusting for the asymptotic Gaussian limit for selection. Under some regularity assumptions on the density of the randomization, including heavier tails than Gaussian satisfied by e.g. logistic distribution, we prove the selective CLT holds without any assumptions on the underlying parameter, allowing for rare selection events. We also show a selective CLT result for Gaussian randomization, though the quantitative results are qualitatively different for the Gaussian randomization as compared to the heavier tailed results. Furthermore, we propose a bootstrap version of this test statistic, which is provably asymptotically pivotal uniformly across a family of non-parametric distributions. This result can be interpreted as resolving the impossibility results of Leeb and Potscher (2006). We describe several sampling methods involving the projected Langevin Monte Carlo to compute the bootstrapped test statistic and the corresponding confidence intervals valid after selection. The applications of our work include valid inferential and sampling tools after running various model selection algorithms including their combinations into multiple views/queries framework. We also present a way to do data carving, providing more powerful tests than classical data splitting by reusing the information in the data from the first stage.

연구 동기 및 목표

  • 다중 쿼리를 사용한 모형 선택 이후 점점 더 중심적인 추론을 제공하는 부트스트랩 절차를 개발하기 위해.
  • 일반적인 랜덤화 밀도를 갖는 비모수 모형, 예를 들어 더 무거운 尾을 가진 분포인 로지스틱 분포를 포함하여 선택적 중심극한정리(CLT)를 비모수 모형으로 확장하기 위해.
  • Leeb와 Pötscher(2006a)의 불가능성 결과를 극복하기 위해 선택 이후에도 균일하게 타당한 추론을 구성함으로써, 희귀한 선택 사건에도 불구하고 유효한 추론을 가능하게 하기 위해.
  • 데이터 캐빙을 가능하게 하고 다중 쿼리에서의 정보를 재사용함으로써, 고전적 데이터 분할보다 더 높은 검정력을 확보하기 위해.
  • 부트스트랩 검정 통계량과 신뢰구간을 계산하기 위한 실용적인 샘플링 알고리즘을 제시하기 위해, 투영 랭귀언 몽테카를로를 사용한다.

제안 방법

  • 다중 쿼리에서의 선택 결과를 조건으로 하는 선택적 중심극한정리(CLT) 프레임워크를 사용하며, 선택 편향을 선택적 우도비를 통해 조정한다.
  • Laplace, 로지스틱, 또는 가우시안과 같은 밀도를 갖는 랜덤화 메커니즘을 적용하여, 기저 매개변수에 대한 가정 없이 선택적 중심극한정리가 성립하도록 보장한다.
  • 비모수 분포의 가족 전반에 걸쳐 균일하게 점점 더 중심적인 부트스트랩 통계량을 갖는 부트스트랩 검정 통계량을 개발한다.
  • 최적화 변수와 랜덤화 매개변수에 기반한 기울기 기반 업데이트를 사용하여, 선택적 부트스트랩 분포에서의 샘플링을 위한 투영 랭귀언 몽테카를로 샘플링을 활용한다.
  • 선택적 부트스트랩의 로그 밀도에 대한 명시적 기울기 표현을 유도하여, 부트스트랩 가중치와 보조 변수에 대한 효율적인 MCMC 샘플링을 가능하게 한다.
  • 두 가지 샘플링 기법을 도입한다: 하나는 선택적 부트스트랩을 위한 것이고, 다른 하나는 와일드 부트스트랩을 위한 것으로, 모두 재매개변수화된 랜덤화 맵과 자코비안 보정을 사용한다.

실험 결과

연구 질문

  • RQ1비정규 또는 더 두꺼운 尾을 가진 오차 분포 조건 하에서도 다중 모형 선택 쿼리 이후 점점 더 중심적인 추론을 제공하는 부트스트랩 절차를 구성할 수 있는가?
  • RQ2기저 매개변수가 유계이거나 선택 경계에서 떨어져 있음을 가정하지 않더라도, 선택적 중심극한정리가 비모수 모형 전반에 걸쳐 균일하게 성립하는가?
  • RQ3모형 선택의 제1단계에서의 정보를 재사용할 수 있도록 데이터 캐빙을 어떻게 구현할 수 있는가? 이는 고전적 데이터 분할 대비 더 높은 검정력을 제공한다.
  • RQ4고차원적이고 i.i.d.가 아닌 설정에서 선택적 부트스트랩 분포를 근사하기 위해 효과적인 샘플링 방법은 무엇인가?
  • RQ5랜덤화된 선택과 부트스트랩 校정을 사용한 선택 후 추론에서, Leeb와 Pötscher(2006a)의 불가능성 결과를 피할 수 있는가?

주요 결과

  • 랜덤화 밀도에 대한 정규성 조건 하에서 선택적 중심극한정리는, 가우시안보다 더 두꺼운 尾을 가진 분포(예: 로지스틱)를 포함하여, 희귀한 선택 사건에서도 기저 매개변수에 대한 가정 없이 성립한다.
  • 가우시안 랜덤화의 경우 선택적 중심극한정리는 여전히 성립하지만, 더 두꺼운 尾을 가진 분포와는 질적으로 다른 점점 더 중심적인 행동을 보인다.
  • 제안된 부트스트랩 검정 통계량은 광범위한 비모수 모형 가족 전반에 걸쳐 점점 더 중심적이며, 다양한 데이터 생성 메커니즘에서 유효한 추론을 보장한다.
  • 기울기 기반 업데이트를 사용하는 투영 랭귀언 몽테카를로 샘플링은 선택 이후 부트스트랩 신뢰구간과 검정 통계량을 효율적으로 계산할 수 있도록 한다.
  • 이 방법은 첫 번째 선택 단계에서의 정보 재사용을 가능하게 하여 데이터 캐빙을 지원하며, 고전적 데이터 분할보다 더 강력한 검정을 가능하게 한다.
  • 이론적 및 실용적 결과는 다중 시각과 그룹 LASSO 설정에서 입증되었으며, GLM과 비정규 오차 분포에 대한 명시적 샘플링 알고리즘이 제시되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.