Skip to main content
QUICK REVIEW

[논문 리뷰] A Leisurely Look at Versions and Variants of the Cross Validation Estimator

Waleed A. Yousef|arXiv (Cornell University)|2019. 07. 31.
Advanced Statistical Methods and Models참고 문헌 19인용 수 11
한 줄 요약

이 논문은 분류에서 오차율과 AUC를 추정하기 위한 교차검증(CV)의 여러 변형을 체계화하고 비교하며, 오직 유일한 샘플을 제외한 교차검증(leave-one-out), K-겹 교차검증(K-fold), 반복 K-겹 교차검증(repeated K-fold)만이 중복되지 않으며 수학적으로 타당하다는 것을 증명한다. 반복 K-겹 교차검증은 유일한 매끄러운 추정기이며, 조건부 성능과 평균 성능 정확도를 실증적으로 거의 동일하게 추정한다. 이 논문은 중복된 변형들을 폐기하고, 종합적인 비교 연구 및 반복 K-겹 교차검증의 엄밀한 분산 추정법을 요구한다.

ABSTRACT

Many versions of cross-validation (CV) exist in the literature; and each version though has different variants. All are used interchangeably by many practitioners; yet, without explanation to the connection or difference among them. This article has three contributions. First, it starts by mathematical formalization of these different versions and variants that estimate the error rate and the Area Under the ROC Curve (AUC) of a classification rule, to show the connection and difference among them. Second, we prove some of their properties and prove that many variants are either redundant or not smooth. Hence, we suggest to abandon all redundant versions and variants and only keep the leave-one-out, the $K$-fold, and the repeated $K$-fold. We show that the latter is the only among the three versions that is smooth and hence looks mathematically like estimating the mean performance of the classification rules. However, empirically, for the known phenomenon of weak correlation, which we explain mathematically and experimentally, it estimates both conditional and mean performance almost with the same accuracy. Third, we conclude the article with suggesting two research points that may answer the remaining question of whether we can come up with a finalist among the three estimators: (1) a comparative study, that is much more comprehensive than those available in literature and conclude no overall winner, is needed to consider a wide range of distributions, datasets, and classifiers including complex ones obtained via the recent deep learning approach. (2) we sketch the path of deriving a rigorous method for estimating the variance of the only smooth version, repeated $K$-fold CV, rather than those ad-hoc methods available in the literature that ignore the covariance structure among the folds of CV.

연구 동기 및 목표

  • 오차율과 AUC 추정에 사용되는 다양한 교차검증 변형들 간의 수학적 체계화와 상호 연결성 및 차이점의 명확화.
  • 기존의 많은 CV 변형들이 중복되거나 매끄럽지 않다는 것을 증명하여, 표준 실무에서의 제거를 정당화.
  • 세 주요 버전 중에서 반복 K-겹 교차검증만이 매끄럽다는 것을 입증함으로써, 분류 규칙의 평균 성능을 수학적으로 일관되게 추정할 수 있도록 함.
  • 두 가지 핵심 연구 방향 제안: (1) 다양한 데이터셋, 분류기(딥러닝 모델 포함), 분포에 대한 종합적인 비교 연구, (2) 겹치는 폴드 간 공분산을 고려한 반복 K-겹 교차검증의 분산 추정 방법에 대한 엄밀한 접근

제안 방법

  • 논문은 유일한 샘플을 제외한 교차검증, K-겹 교차검증, 반복 K-겹 교차검증을 포함한 다양한 CV 버전에서 오차율과 AUC 추정의 수학적 체계화를 제공한다.
  • 수학적 분석을 통해 매끄러움이 신뢰할 만한 추정에 필수적임을 보여주며, 많은 CV 변형이 중복되거나 매끄럽지 않다는 것을 증명한다.
  • 반복 K-겹 교차검증이 유일하게 매끄럽다는 것을 입증하며, 이는 분류 규칙의 평균 성능을 추정하는 추정기로 작동한다는 의미이다.
  • 실증적으로 반복 K-겹 교차검증이 폴드 간 약한 상관관계에도 불구하고 조건부 성능과 평균 성능을 거의 동일한 정확도로 추정함을 보여준다.
  • 폴드 간 공분산의 구조를 고려함으로써 반복 K-겹 교차검증에 대한 엄밀한 분산 추정기 유도 경로를 제안한다.
  • 비매끄럽고 중복된 CV 변형들을 폐기하고, 유일한 세 핵심 버전인 유일한 샘플을 제외한 교차검증, K-겹 교차검증, 반복 K-겹 교차검증을 권장한다.

실험 결과

연구 질문

  • RQ1어떤 교차검증 버전이 수학적으로 중복되거나 매끄럽지 않은가? 그리고 왜 이를 표준 실무에서 폐기해야 하는가?
  • RQ2왜 폴드 간 약한 상관관계가 존재함에도 불구하고 반복 K-겹 교차검증은 조건부 성능과 평균 성능을 잘 추정하는가?
  • RQ3다양한 데이터셋, 분류기(딥러닝 모델 포함), 분포에 걸쳐 수행된 종합적인 비교 연구를 통해 단일 최적의 CV 추정기를 식별할 수 있는가?
  • RQ4반복 K-겹 교차검증의 분산 추정기로서, 폴드 수준의 공분산을 적절히 반영하는 엄밀한 방법을 유도하는 것은 가능한가? 아니면 기계적 방법에 의존하는가?
  • RQ5오차율과 AUC 추정에서 교차검증 추정기의 수학적 성질을 어떻게 체계화할 수 있는가? 이는 그들 간의 상호 연결성과 차이점을 명확히 한다.

주요 결과

  • 기존의 많은 교차검증 변형은 수학적으로 중복되거나 매끄럽지 않아 신뢰성에 악영향을 미치며, 표준 실무에서의 제거를 정당화한다.
  • 세 주요 버전 중에서 반복 K-겹 교차검증만이 매끄럽고, 이는 분류 규칙의 평균 성능을 수학적으로 일관되게 추정할 수 있도록 한다.
  • 폴드 간 약한 상관관계에도 불구하고 반복 K-겹 교차검증은 실증적으로 조건부 성능과 평균 성능을 거의 동일한 정확도로 추정한다.
  • 논문은 오직 세 가지 CV 버전—유일한 샘플을 제외한 교차검증, K-겹 교차검증, 반복 K-겹 교차검증—만을 유지해야 하며, 그 중에서도 반복 K-겹 교차검증이 매끄러움으로 인해 가장 타당하다고 결론을 내린다.
  • 저자들은 두 가지 핵심 연구 갭을 규명한다: (1) CV 추정기의 대규모 종합 비교 연구가 필요하며, (2) 반복 K-겹 교차검증의 폴드 공분산을 고려한 엄밀한 분산 추정기가 필요하다.
  • 논문은 기계적 방법에 의존하는 분산 추정 기법을 기각하고, 반복 K-겹 교차검증의 기초 통계적 구조를 존중하는 방법론적 프레임워크를 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.