Skip to main content
QUICK REVIEW

[논문 리뷰] Recommending Training Set Sizes for Classification

Phillip Koshute, Jared Zook|arXiv (Cornell University)|2021. 02. 16.
Machine Learning in Healthcare참고 문헌 15인용 수 6
한 줄 요약

이 논문은 이진 분류 및 다중 분류 작업에 대한 최적의 훈련 세트 크기를 결정하기 위해 다섯 가지 분류 방법을 사용하여 20개의 벤치마크 데이터셋을 분석한다. 데이터셋의 클래스 수와 특성 수를 바탕으로 데이터 기반 범위인 3,000에서 30,000개의 샘플을 제안하며, 학습 곡선 분석과 수렴 기반 충분한 훈련 세트 크기(STSS) 추정을 통해 비용을 최소화하면서도 모델 성능을 확보한다.

ABSTRACT

Based on a comprehensive study of 20 established data sets, we recommend training set sizes for any classification data set. We obtain our recommendations by systematically withholding training data and developing models through five different classification methods for each resulting training set. Based on these results, we construct accuracy confidence intervals for each training set size and fit the lower bounds to inverse power low learning curves. We also estimate a sufficient training set size (STSS) for each data set based on established convergence criteria. We compare STSS to the data sets' characteristics; based on identified trends, we recommend training set sizes between 3000 and 30000 data points, according to a data set's number of classes and number of features. Because obtaining and preparing training data has non-negligible costs that are proportional to data set size, these results afford the potential opportunity for substantial savings for predictive modeling efforts.

연구 동기 및 목표

  • 분류 작업에서 모델 성능과 데이터 확보 비용을 균형 잡는 최적의 훈련 세트 크기를 결정하기 위해.
  • 데이터셋 특성(클래스 수와 특성 수)과 효과적인 훈련 세트 크기 사이의 추세를 규명하기 위해.
  • 다양한 분류 문제에 걸쳐 실용적이고 데이터 기반의 훈련 세트 크기 선택 추천을 제공하기 위해.
  • 학습 곡선 행동 기반 수렴 기준을 사용하여 충분한 훈련 세트 크기(STSS)를 추정하기 위해.
  • 데이터 수집 및 준비 비용을 줄이기 위해 최소한이지만 효과적인 훈련 세트 크기를 추천하기 위해.

제안 방법

  • 20개의 벤치마크 데이터셋에서 훈련 데이터를 체계적으로 제거하여 다양한 크기의 훈련 세트를 생성한다.
  • 각 축소된 훈련 세트에 대해 다섯 가지 다른 분류 모델을 훈련시어 크기에 따른 성능을 평가한다.
  • 각 훈련 세트 크기에 대해 정확도 신뢰구간을 구축하여 불확실성을 정량화한다.
  • 정확도의 하한 신뢰구간을 역거듭제곱 학습 곡선에 적합시켜 성능 저하를 모델링한다.
  • 학습 곡선 행동 기반 수렴 임계값을 사용하여 충분한 훈련 세트 크기(STSS)를 추정한다.
  • STSS를 데이터셋 특성(클래스 수와 특성 수)과 상관관계를 분석하여 일반화 가능한 추천을 도출한다.

실험 결과

연구 질문

  • RQ1다양한 분류 데이터셋에서 안정적이고 높은 모델 정확도를 보장하는 훈련 세트 크기는 무엇인가?
  • RQ2데이터셋의 클래스 수와 특성 수가 필요한 훈련 세트 크기에 어떻게 영향을 미치는가?
  • RQ3다양한 알고리즘에 걸쳐 모델 성능이 수렴하는 데 필요한 최소 훈련 세트 크기는 무엇인가?
  • RQ4학습 곡선 행동을 어떻게 모델링하여 최적의 훈련 세트 크기를 예측할 수 있는가?
  • RQ5데이터셋 특성에 기반한 훈련 세트 크기 선택을 통해 데이터 수집 비용을 얼마나 줄일 수 있는가?

주요 결과

  • 이 연구는 클래스 수와 특성 수에 따라 3,000에서 30,000개의 데이터 포인트 사이의 훈련 세트 크기를 추천한다.
  • 더 많은 클래스나 더 높은 특성 수를 가진 데이터셋은 최적의 성능를 달성하기 위해 일반적으로 더 큰 훈련 세트가 필요하다.
  • 모든 20개의 데이터셋에서 수렴 기반 기준을 사용하여 충분한 훈련 세트 크기(STSS)가 일관되게 추정되었다.
  • 정확도의 하한 신뢰구간에 대한 역거듭제곱 법칙 적합은 다양한 훈련 세트 크기에서의 성능을 예측하는 데 강력한 방법을 제공하였다.
  • 일정한 훈련 세트 크기를 초과하면 모델 성능이 안정화되어 더 큰 데이터셋에 대해 수익 감소 효과가 나타났다.
  • 제안된 추천은 모델 정확도를 훼손하지 않으면서도 데이터 확보 및 준비 비용을 상당히 절감할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.