Skip to main content
QUICK REVIEW

[논문 리뷰] Similarity Based Stratified Splitting: an approach to train better classifiers

Felipe Farias, Teresa B. Ludermir|arXiv (Cornell University)|2020. 10. 12.
Text and Document Classification Technologies인용 수 10
한 줄 요약

이 논문은 유사도 기반 분류 분할(SBSS)을 제안하며, 입력 공간과 출력 공간의 유사도를 활용하여 유사한 샘플을 서로 다른 훈련 및 테스트 폴드에 분산시킴으로써 분류기 성능을 향상시키는 새로운 데이터 분할 방법이다. 다양한 분류기로 22개 데이터셋에서 평가한 결과, 기준 10겹 교차검증 대비 75%의 경우에서 테스트 정확도가 유의하게 향상되었으며, 실세계 모델 일반화를 향상시키는 저비용이며 분류기 독립적인 전략임을 입증하였다.

ABSTRACT

We propose a Similarity-Based Stratified Splitting (SBSS) technique, which uses both the output and input space information to split the data. The splits are generated using similarity functions among samples to place similar samples in different splits. This approach allows for a better representation of the data in the training phase. This strategy leads to a more realistic performance estimation when used in real-world applications. We evaluate our proposal in twenty-two benchmark datasets with classifiers such as Multi-Layer Perceptron, Support Vector Machine, Random Forest and K-Nearest Neighbors, and five similarity functions Cityblock, Chebyshev, Cosine, Correlation, and Euclidean. According to the Wilcoxon Sign-Rank test, our approach consistently outperformed ordinary stratified 10-fold cross-validation in 75\\% of the assessed scenarios.

연구 동기 및 목표

  • 기존의 데이터 분할 방법이 입력 공간의 유사도를 고려하지 못해 최적의 모델 일반화가 이루어지지 않는 문제를 해결하기 위해.
  • 훈련 및 테스트 세트에 데이터 분포가 더 잘 반영되도록 하여 모델 성능을 향상시키는 데이터 분할 전략을 개발하기 위해.
  • 학습 알고리즘을 수정하지 않고도 모델 일반화를 향상시키는 분류기 독립적이고 저비용의 방법을 제안하기 위해.
  • 통계적 유의성 검정을 통해 다양한 데이터셋과 분류기에서 SBSS의 효과를 평가하기 위해.
  • 예를 들어 유클리드, 코사인, 상관계수와 같은 다양한 유사도 함수가 SBSS 하에서 모델 성능에 미치는 영향을 탐구하기 위해.

제안 방법

  • SBSS는 입력 공간 내 샘플 간의 쌍별 거리를 측정하기 위해 유사도 함수를 사용하며, 입력 특징과 출력 레이블을 모두 고려한다.
  • 유사도에 기반해 샘플을 군집화한 후, 폴드 내 유사도를 최소화하면서도 클래스 분포를 유지하도록 분할한다.
  • 클래스 비율이 폴드 간에 일관되게 유지되도록 분류 분할 기법을 적용하며, 유사도 제약 조건을 통해 훈련 데이터의 중복을 줄인다.
  • 성능에 미치는 영향을 평가하기 위해 도시블록, 체비셰프, 코사인, 상관계수, 유클리드의 다섯 가지 유사도 함수를 평가한다.
  • 유사한 샘플이 서로 다른 폴드에 배치되도록 알고리즘이 설계되어, 훈련 과정에서 다양성이 증가하고 일반화가 향상된다.
  • SBSS는 10겹 교차검증 프레임워크에 적용되며, Wilcoxon 부호순위 검정을 통해 표준 분류 10겹 교차검증과 성능을 비교한다.

실험 결과

연구 질문

  • RQ1입력 공간의 유사도를 데이터 분할에 통합할 경우, 표준 분류 분할 대비 분류기 일반화 성능이 향상되는가?
  • RQ2유사도 함수의 선택(예: 유클리드, 코사인, 상관계수)이 SBSS의 성능 향상에 어떤 영향을 미치는가?
  • RQ3SBSS는 다양한 데이터셋과 분류기 유형에서 일관되게 모델 성능을 향상시킬 수 있는가?
  • RQ4SBSS의 성능 향상은 다수의 벤치마크 데이터셋에서 통계적으로 유의한가?
  • RQ5더 나은 데이터 분포 표현을 통해 SBSS는 과적합을 줄이고 실세계 성능 추정을 향상시키는가?

주요 결과

  • SBSS는 평가된 시나리오의 75%에서 표준 10겹 교차검증을 뛰어넘었으며, Wilcoxon 부호순위 검정을 통해 통계적 유의성이 확인되었다.
  • 22개 데이터셋과 네 가지 분류기(MLP, SVM, KNN, RF)를 대상으로 총 440회의 비교에서 330회(75%)에서 테스트 정확도가 향상되었다.
  • SVM 분류기에서 상관계수 유사도를 사용한 SBSS는 표준 10겹 교차검증 대비 평균 1.121%의 정확도 향상을 기록했으며, 통계 테스트에서 16승 0패를 기록했다.
  • 모든 데이터셋과 분류기에서의 평균 정확도 향상은 훈련 세트 기준 0.428%, 테스트 세트 기준 1.547%였으며, Wilcoxon 검정 결과는 1승/12무/9패였다.
  • SBSS는 고차원 데이터셋(예: 'vowel', 'madelon')과 불균형 데이터셋(예: 'credit-g', 'diabetes')을 포함한 다양한 데이터셋에서 일관된 향상을 보였다.
  • 이 방법은 분류기 독립적이며 최소한의 계산 비용을 수반하여 학술 및 산업 분야의 기계학습 파이프라인에 쉽게 구현 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.