Skip to main content
QUICK REVIEW

[논문 리뷰] Constructing Confidence Intervals for 'the' Generalization Error -- a Comprehensive Benchmark Study

Hannah Schulz-Kümpel, Sebastian Fischer|arXiv (Cornell University)|2024. 09. 27.
Scientific Measurement and Uncertainty EvaluationDecision Sciences인용 수 3
한 줄 요약

이 논문은 18개의 표형 데이터셋, 4개의 학습 알고리즘, 8개의 손실 함수를 바탕으로 기계학습에서 일반화 오차에 대한 신뢰구간(CI)을 구성하기 위한 13개의 모델에 종속되지 않는 방법에 대한 종합적인 벤치마크를 제시한다. 커버리지 빈도, 폭, 실행 시간을 평가하여, 소규모 데이터(n ≤ 100)에는 외부 반복 수 25회, K=5를 갖는 네스티드 크로스볼루션을, 더 큰 데이터셋에는 비율 0.9, 반복 수 25회를 갖는 보정된 리샘플링-t 방법을 권장한다.

ABSTRACT

When assessing the quality of prediction models in machine learning, confidence intervals (CIs) for the generalization error, which measures predictive performance, are a crucial tool. Luckily, there exist many methods for computing such CIs and new promising approaches are continuously being proposed. Typically, these methods combine various resampling procedures, most popular among them cross-validation and bootstrapping, with different variance estimation techniques. Unfortunately, however, there is currently no consensus on when any of these combinations may be most reliably employed and how they generally compare. In this work, we conduct a large-scale study comparing CIs for the generalization error, the first one of such size, where we empirically evaluate 13 different CI methods on a total of 19 tabular regression and classification problems, using seven different inducers and a total of eight loss functions. We give an overview of the methodological foundations and inherent challenges of constructing CIs for the generalization error and provide a concise review of all 13 methods in a unified framework. Finally, the CI methods are evaluated in terms of their relative coverage frequency, width, and runtime. Based on these findings, we can identify a subset of methods that we would recommend. We also publish the datasets as a benchmarking suite on OpenML and our code on GitHub to serve as a basis for further studies.

연구 동기 및 목표

  • 기계학습에서 일반화 오차에 대한 신뢰구간(CI)을 신뢰성 있게 생성하는 데에 효과적인 리샘플링 및 분산 추정 방법에 대한 합의 부족을 해결하기 위해.
  • 다양한 표형 회귀 및 분류 문제에 걸쳐 대규모 벤치마크를 통해 기존의 13개의 방법을 실증적으로 비교하기 위해.
  • 이러한 방법들의 성능을 커버리지 빈도, CI 폭, 계산 비용, 다양한 데이터 크기, 모델, 손실 함수에 따른 안정성 측면에서 평가하기 위해.
  • 공개된 소스 코드와 OpenML 및 GitHub에 배포된 데이터셋을 바탕으로 실무자들을 위한 실질적인 권장 사항을 제공하기 위해.
  • 표준화된 벤치마크 세트를 제공하고 이론적 분석 외에도 실증적 검증의 중요성을 부각시킴으로써 향후 방법론 평가의 기초를 마련하기 위해.

제안 방법

  • 이 연구는 일반화 오차에 대한 CI를 구성하기 위한 13개의 기존 모델에 종속되지 않는 방법을 평가한다. 이는 크로스볼루션, 부트스트래핑, 분산 추정 기법의 변형을 포함한다.
  • 각 방법은 리샘플링 절차(예: K-폴드 크로스볼루션, 반복 크로스볼루션, 부트스트래핑)와 다양한 분산 추정 전략(예: 링크내이프, 분산 비율, t-통계 보정)을 조합한다.
  • 벤치마크는 18개의 표형 데이터셋—17개는 이 연구를 위해 특별히 생성된 것—을 사용하며, 이는 4개의 지도 학습 알고리즘(인듀서)과 8개의 손실 함수를 포함하여 분류 및 회귀 작업 모두를 다룬다.
  • 성능 평가는 세 가지 주요 지표를 사용한다: 상대 커버리지 빈도(진짜 일반화 오차가 CI 내에 포함되는 빈도), 평균 폭(정밀도), 실행 시간(계산 비용).
  • 모든 13개 방법을 일관되게 기술하고 비교할 수 있도록 통합 프레임워크를 도입하여 다양한 접근 방식 간의 일관된 평가 및 해석이 가능하도록 한다.
  • 모든 데이터셋은 OpenML에 배포되었으며, 코드는 GitHub에 공개되어 재현성과 향후 벤치마크를 지원한다.

실험 결과

연구 질문

  • RQ1리샘플링 및 분산 추정 방법의 어떤 조합이 일반화 오차의 CI에 대해 가장 신뢰할 수 있는 커버리지 빈도를 제공하는가?
  • RQ2다양한 방법 간의 CI 폭은 어떻게 달라지며, 커버리지 정확도와 정밀도 사이의 상충 관계는 어떠한가?
  • RQ3각 방법의 계산 비용은 무엇이며, 데이터 크기와 모델 복잡도에 따라 어떻게 변화하는가?
  • RQ4소규모 데이터(n ≤ 100)와 더 큰 데이터(n > 100) 간에 방법들의 성능 특성은 어떻게 다를까?
  • RQ5다양한 데이터 생성 과정, 학습 알고리즘, 손실 함수에 걸쳐 어떤 방법이 강건성과 안정성을 보여주는가?

주요 결과

  • 소규모 데이터(n ≤ 100)의 경우, 최소 25회의 외부 반복 수와 K=5를 갖는 네스티드 크로스볼루션, 또는 최소 25회의 외부 반복 수와 K≥10을 갖는 콘сер바티브-Z 방법이 가장 안정적인 커버리지와 수용 가능한 폭을 제공한다.
  • 더 큰 데이터셋의 경우, 비율 0.9와 최소 25회의 반복을 갖는 보정된 리샘플링-t 방법이 커버리지 정확도와 폭의 최적의 균형을 이룬다.
  • 약간 넓은 CI가 허용된다면, 더 큰 데이터셋에 대해서도 외부 반복 수 3회, K=5를 갖는 네스티드 크로스볼루션 또는 외부 반복 수 10회, K=5를 갖는 콘서바티브-Z 방법도 권장된다.
  • 이 연구는 커버리지 빈도가 방법 설정에 매우 민감하며, 일부 방법은 데이터 크기나 모델 유형에 따라 심각한 과도 또는 과소 커버리지가 나타남을 밝혀냈다.
  • 계산 비용은 크게 다름: 반복적인 모델 피팅을 포함하는 방법들(예: 반복 크로스볼루션)은 단일 통과 또는 분산 추정 기반 접근보다 훨씬 느리다.
  • 벤치마크 결과로는 어떤 한 방법도 모든 지표에서 항상 뛰어나지 않지만, 커버리지와 폭의 균형 측면에서 일관되게 상위 성능을 보이는 몇몇 방법들이 존재함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.