Skip to main content
QUICK REVIEW

[논문 리뷰] Optimality of Training/Test Size and Resampling Effectiveness of Cross-Validation Estimators of the Generalization Error

Georgios Afendras, Marianthi Markatou|arXiv (Cornell University)|2015. 11. 10.
Statistical Methods and Inference참고 문헌 23인용 수 12
한 줄 요약

이 논문은 일반적인 손실 함수의 광범위한 클래스에 대해 k-폴드 교차검증에서 최적의 훈련 세트 크기는 총 표본 크기의 정확히 반으로, 일반화 오차 추정기의 분산을 최소화함을 규명한다. 이는 잠재적 재표본화 효율성이라는 지표를 도입하고, 분산 최소화를 통해 최적의 분할 규칙을 유도하며, 로지스틱 회귀를 사용한 분류 문제에서 이론적 및 실증적으로 검증된다.

ABSTRACT

An important question in constructing Cross Validation (CV) estimators of the generalization error is whether rules can be established that allow "optimal" selection of the size of the training set, for fixed sample size $n$. We define the {\it resampling effectiveness} of random CV estimators of the generalization error as the ratio of the limiting value of the variance of the CV estimator over the estimated from the data variance. The variance and the covariance of different average test set errors are independent of their indices, thus, the resampling effectiveness depends on the correlation and the number of repetitions used in the random CV estimator. We discuss statistical rules to define optimality and obtain the "optimal" training sample size as the solution of an appropriately formulated optimization problem. We show that in a broad class of loss functions the optimal training size equals half of the total sample size, independently of the data distribution. We optimally select the number of folds in $k$-fold cross validation and offer a computational procedure for obtaining the optimal splitting in the case of classification (via logistic regression). We substantiate our claims both, theoretically and empirically.

연구 동기 및 목표

  • 고정된 총 표본 크기에서 일반화 오차 추정기의 분산을 최소화하는 교차검증에서의 최적 훈련 세트 크기를 규명하는 것.
  • 랜덤 교차검증에서 제한 분산 대 관측 분산의 비율로 정의된 재표본화 효율성을 정의하고 정량화하는 것.
  • 고정된 총 표본 크기 하에서 최적의 훈련/테스트 크기 선택을 위한 최적화 문제를 수립하고 해결하는 것.
  • 결과를 k-폴드 교차검증으로 확장하고, 로지스틱 회귀를 사용한 분류 작업을 위한 계산 절차를 제공하는 것.
  • 이론적 분석과 실증 시뮬레이션을 통해 이론적 발견을 검증하는 것.

제안 방법

  • 재표본화 효율성을 교차검증 추정기의 제한 분산에 대한 데이터로부터 추정된 분산의 비율로 정의한다.
  • 예측 오차의 渐近 정규성을 사용하여, 폴드와 반복 횟수 간의 예측 오차의 결합 모멘트를 유도한다.
  • 예측 오차 벡터에 대해 다변량 정규 근사법을 적용하며, 이는 훈련 크기와 폴드 간 중복 여부에 따라 달라지는 공분산 구조를 가진다.
  • 지표 함수를 사용하여 훈련 세트에 포함된 데이터 포인트에 대한 기대값을 활용해, 교차검증 추정기의 분산을 훈련 크기 $ n_1 $ 의 함수로 유도한다.
  • 이 분산을 최소화하는 최적화 문제를 해결하며, 일반적인 손실 함수의 광범위한 클래스에서 최소값이 $ n_1 = n/2 $ 에서 발생함을 보여준다.
  • 관측된 분산을 최소화하는 기반으로, 분류 작업을 위한 최적의 분할을 위한 계산 알고리즘을 제안한다.

실험 결과

연구 질문

  • RQ1고정된 총 표본 크기에서 일반화 오차 추정기의 분산을 최소화하는 훈련 세트 크기는 무엇인가?
  • RQ2랜덤 교차검증에서 재표본화 효율성을 어떻게 공식적으로 정의하고 정량화할 수 있는가?
  • RQ3최적의 훈련 크기는 데이터 분포나 손실 함수에 따라 달라지며, 만약 그렇다면 어떤 조건에서 그러한 영향을 받는가?
  • RQ4k-폴드 교차검증에서 최적의 폴드 수는 분산 최소화에서 유도될 수 있는가?
  • RQ5제안된 방법은 로지스틱 회귀를 사용한 분류 작업에서 실증적으로 어떻게 성능을 발휘하는가?

주요 결과

  • 일반적인 손실 함수의 광범위한 클래스에서 최적의 훈련 세트 크기는 정확히 $ n/2 $ 로, 기저 데이터 분포와 무관하다.
  • 재표본화 효율성은 랜덤 CV에서 테스트 세트 오차 간 상관관계와 반복 횟수에 따라 달라지며, 상관관계가 높을수록 효율성이 감소한다.
  • 교차검증 추정기의 분산은 훈련 세트 크기가 총 표본 크기의 반일 때 최소가 되며, 이는 渐近 분포 분석을 통해 입증된다.
  • 최적의 폴드 수는 동일한 분산 최소화 프레임워크에서 도출되며, 이론적 근거가 있다.
  • 로지스틱 회귀를 사용한 분류 작업에서 최적의 분할을 선택하기 위한 계산 절차가 제안되며, 이는 관측된 분산을 최소화하는 데 기반한다.
  • 이론적 결과는 실증적 시뮬레이션을 통해 확인되었으며, 다양한 설정에서 $ n_1 = n/2 $ 가 최적이 됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.