Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Validation with Confidence

Jing Lei|arXiv (Cornell University)|2017. 03. 23.
Statistical Methods and Inference참고 문헌 28인용 수 9
한 줄 요약

이 논문은 과적합을 방지하기 위해 교차검증 테스트 샘플의 불확실성을 고려하는 통계적으로 타당한 방법인 Confidence를 가진 교차검증(Cross-Validation with Confidence, CVC)을 소개한다. p-값을 교차검증 잔차 기반으로 계산하는 가설 검정 프레임워크를 사용함으로써, CVC는 최적 모델이 보장된 확률로 포함된 신뢰도 집합을 출력하며, 기존의 분할 비율을 그대로 사용하는 상황에서도 일관된 변수 선택을 가능하게 한다.

ABSTRACT

Cross-validation is one of the most popular model selection methods in statistics and machine learning. Despite its wide applicability, traditional cross validation methods tend to select overfitting models, due to the ignorance of the uncertainty in the testing sample. We develop a new, statistically principled inference tool based on cross-validation that takes into account the uncertainty in the testing sample. This new method outputs a set of highly competitive candidate models containing the best one with guaranteed probability. As a consequence, our method can achieve consistent variable selection in a classical linear regression setting, for which existing cross-validation methods require unconventional split ratios. When used for regularizing tuning parameter selection, the method can provide a further trade-off between prediction accuracy and model interpretability. We demonstrate the performance of the proposed method in several simulated and real data examples.

연구 동기 및 목표

  • 기존 교차검증에서 테스트 샘플의 불확실성을 忽시함으로써 발생하는 과적합 문제를 해결하기 위해.
  • 최적 모델이 보장된 확률로 포함된 신뢰도 집합을 제공하는 통계적으로 타당한 추론 도구를 개발하기 위해.
  • 기존 방법이 실패하는 상황에서, 기존의 V-폴드 교차검증 분할 비율을 사용하여 저차원 선형 회귀에서 일관된 변수 선택을 달성하기 위해.
  • 조정 파rameter 선택에서 예측 정확도와 모델 해석 가능성 사이의 견고한 트레이드오프를 제공하기 위해.
  • 유의미한 위험 최소화 설정에서 교차검증의 신뢰성을 높이기 위해 유형 I 오류를 통제하고, 경쟁력 있는 모델들이 높은 확률로 포함되도록 보장하기 위해.

제안 방법

  • CVC는 각 후보 모델에 대해 그 예측 위험이 모든 모델 중에서 가장 작은지 검정하는 가설 검정을 수립한다.
  • 고차원 정규분포 비교 프레임워크 하에서, 모든 후보 모델 간의 교차검증 잔차를 비교하여 p-값을 계산한다.
  • 약한 모멘트 가정 하에서 검정 통계량의 渐近적 행동을 제어하기 위해 자기정규화된 중간편차 결과를 사용한다.
  • 사전 설정된 유의수준에서 귀무가설(모델의 위험이 가장 작다)을 기각하지 않은 모델의 부분집합으로 신뢰도 집합을 구성한다.
  • 절차는 V-폴드 교차검증의 각 폴드에 대해 별도로 적용되며, 유한표본 커버리지 보장을 위해 유니온 바ounds를 통해 통합된다.
  • 최근의 고차원 정규분포 비교 결과(Chernozhukov 등)를 활용하여, 검정 통계량에서 상관관계가 있고 이방성인 잔차를 다룬다.

실험 결과

연구 질문

  • RQ1테스트 샘플의 불확실성을 고려함으로써 교차검증을 통계적으로 타당하게 만들 수 있는가?
  • RQ2제안된 방법은 기존의 V-폴드 교차검증 분할 비율 하에서 선형 회귀에서 일관된 변수 선택을 달성하는가?
  • RQ3기존 교차검증이 실패하는 상황에서도, 최적 모델이 높은 확률로 포함된 신뢰도 집합을 제공할 수 있는가?
  • RQ4조정 파rameter 선택에서 예측 정확도와 모델 해석 가능성 사이의 균형을 어떻게 유지하는가?
  • RQ5약한 규칙성 조건 하에서, 신뢰도 집합의 커버리지 확률에 대해 어떤 이론적 보장을 확보할 수 있는가?

주요 결과

  • 모든 가설 검정을 수준 α에서 수행할 경우, CVC가 출력하는 신뢰도 집합은 최적 모델을 최소 1−α의 확률로 포함한다.
  • CVC의 신뢰도 집합 내 가장 작은 모델은 기존의 분할 비율 하에서 선형 회귀에서 일관된 변수 선택을 달성하며, 표준 교차검증과는 달리 그러한 성능을 보인다.
  • 높은 확률로, 예측 위험 측면에서 매우 경쟁력 있는 모델들만 포함된다.
  • 표본 크기가 증가함에 따라, 최적 모델이 선택된 집합에 포함될 확률이 1에 수렴하도록 보장한다.
  • 유형 I 오류를 통제하고, 오차의 유한한 두 번째 모멘트와 예측변수의 유한한 네 번째 모멘트를 포함한 약한 모멘트 가정 하에서도 커버리지가 유지된다.
  • 자기정규화된 중간편차 결과와 고차원 정규분포 비교 기법을 사용하여 이론적 보장을 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.