Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Sampling Techniques for Learning an Imbalanced Data Set

Maureen Lyndel C Lauron, Jaderick P. Pabico|arXiv (Cornell University)|2016. 01. 18.
Imbalanced Data Classification Techniques참고 문헌 2인용 수 4
한 줄 요약

이 논문은 다중 클래스 불균형 데이터에서 분류기 성능을 햖스키기 위해 다섯 가지 새로운 샘플링 기법—SMOTERandRep, Lax Random Oversampling (LRO), Lax Random Undersampling (LRU), 그리고 두 가지 병합 기법 (C-LROU 및 C-LRUO)—을 제안한다. 대학 학생 데이터셋을 대상으로 stackingC 앙상블 분류기를 사용한 결과, LRO, SMOTE, SMOTERandRep가 F-measure(0.5–0.65)와 G-mean(0.86, 0.84, 0.83)에서 가장 높은 성능을 보이며 전통적인 방법과 언더샘플링 기법을 능가했다.

ABSTRACT

This paper presents the performance of a classifier built using the stackingC algorithm in nine different data sets. Each data set is generated using a sampling technique applied on the original imbalanced data set. Five new sampling techniques are proposed in this paper (i.e., SMOTERandRep, Lax Random Oversampling, Lax Random Undersampling, Combined-Lax Random Oversampling Undersampling, and Combined-Lax Random Undersampling Oversampling) that were based on the three sampling techniques (i.e., Random Undersampling, Random Oversampling, and Synthetic Minority Oversampling Technique) usually used as solutions in imbalance learning. The metrics used to evaluate the classifier's performance were F-measure and G-mean. F-measure determines the performance of the classifier for every class, while G-mean measures the overall performance of the classifier. The results using F-measure showed that for the data without a sampling technique, the classifier's performance is good only for the majority class. It also showed that among the eight sampling techniques, RU and LRU have the worst performance while other techniques (i.e., RO, C-LRUO and C-LROU) performed well only on some classes. The best performing techniques in all data sets were SMOTE, SMOTERandRep, and LRO having the lowest F-measure values between 0.5 and 0.65. The results using G-mean showed that the oversampling technique that attained the highest G-mean value is LRO (0.86), next is C-LROU (0.85), then SMOTE (0.84) and finally is SMOTERandRep (0.83). Combining the result of the two metrics (F-measure and G-mean), only the three sampling techniques are considered as good performing (i.e., LRO, SMOTE, and SMOTERandRep).

연구 동기 및 목표

  • UPLB에서 학생 성과 예측과 같은 학술 분류 과제에서 다중 클래스 불균형 데이터 문제를 해결하기 위해.
  • 다수 클래스 성능을 저하시키지 않은 채 소수 클래스 성능을 향상시키기 위해.
  • 기존 방법들인 RU, RO, SMOTE와 비교하여 SMOTERandRep, LRO, LRU, C-LROU, C-LRUO와 같은 새로운 샘플링 기법의 효과성을 평가하기 위해.
  • F-measure와 G-mean 지표를 사용하여 소수 클래스와 다수 클래스 성능 간의 최적 균형을 이룰 수 있는 샘플링 기법을 규명하기 위해.

제안 방법

  • SMOTERandRep(랜덤 복제를 적용한 SMOTE), Lax Random Oversampling (LRO), Lax Random Undersampling (LRU), 그리고 두 가지 병합 기법(C-LROU 및 C-LRUO)을 포함한 다섯 가지 새로운 샘플링 기법을 제안하였다.
  • 13개 클래스를 포함한 2,297건의 학생 기록으로 구성된 실제 다중 클래스 불균형 데이터셋에 이러한 기법을 적용하였다. 이 중 12개 클래스는 소수 클래스였다.
  • 전반적인 분류 성능 향상을 위해 SVM, k-NN, C4.5, CART, 다층 퍼셉트론을 조합한 stackingC 앙상블 분류기를 사용하였다.
  • 모델 평가를 위해 정형화된 10겹 교차검증을 사용하였으며, 성능 지표로 F-measure와 G-mean을 산정하였다.
  • G-mean은 모든 클래스의 재현율 값의 기하 평균을 사용하여 계산되었으며, 공식은 G-mean = (∏ᵢ₌₁ᶜ rcᵢ)^(1/c)이다. 여기서 rcᵢ는 클래스 i에 대한 재현율을 의미한다.
  • SMOTE, stackingC, 모든 평가 지표를 구현하기 위해 WEKA를 사용하여 재현 가능성과 표준화를 확보하였다.

실험 결과

연구 질문

  • RQ1다중 클래스 불균형 데이터셋에서 어떤 샘플링 기법이 소수 클래스 전반에 걸쳐 분류기 성능을 가장 효과적으로 향상시키는가?
  • RQ2제안된 샘플링 기법들—LRO, LRU, C-LROU, C-LRUO, SMOTERandRep—은 전통적 방법들인 RU, RO, SMOTE와 비교해 F-measure와 G-mean 측면에서 어떻게 다른가?
  • RQ3소수 클래스와 다수 클래스 양쪽에서 높은 성능을 유지하는 데 있어 오버샘플링이 언더샘플링을 능가하는가?
  • RQ4어떤 병합 샘플링 기법들(예: C-LROU)은 높은 F-measure를 보이지만 낮은 G-mean을 보이며, 이는 클래스별 성능과 종합적 성능 사이의 상충 관계를 나타내는가?
  • RQ5제안된 LRO 및 SMOTERandRep 기법들이 기존 최첨단 기법들과 비교해 소수 클래스와 다수 클래스 성능 간의 균형을 더 잘 달성할 수 있는가?

주요 결과

  • Lax Random Oversampling (LRO)는 0.86의 최고 G-mean 점수를 기록하여 모든 다른 샘플링 기법들보다 종합적인 분류기 성능에서 뛰어난 성능을 보였다.
  • SMOTE는 G-mean 0.84와 모든 클래스에서 0.5에서 0.65 사이의 F-measure를 기록하여 강력하고 균형 잡힌 성능을 보였다.
  • SMOTERandRep는 가장 성능이 열악한 클래스(SDW)에서 G-mean 0.83과 F-measure 0.52를 기록하여 소수 클래스 학습이 일관되게 이루어지는 것으로 나타났다.
  • 랜덤 언더샘플링(RU)과 라크 랜덤 언더샘플링(LRU)은 다수 클래스 정보 손실로 인해 가장 열악한 F-measure와 G-mean 성능을 보였다.
  • 병합 기법인 C-LROU는 대부분의 클래스에서 높은 F-measure를 기록했지만 G-mean가 0.85로 낮아, 소수 클래스 성능은 뛰어나지만 다수 클래스 성능이 희생된 것으로 나타났다.
  • 모든 기법들 중에서 LRO, SMOTE, SMOTERandRep만이 F-measure와 G-mean 양쪽에서 일관되게 뛰어난 성능을 보이며, 불균형 다중 클래스 학습에 있어 가장 효과적인 기법으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.