Skip to main content
QUICK REVIEW

[논문 리뷰] A Synthetic Over-sampling method with Minority and Majority classes for imbalance problems

Hadi Akbarzadeh Khorshidi, Uwe Aickelin|arXiv (Cornell University)|2020. 11. 09.
Advanced Statistical Process Monitoring인용 수 4
한 줄 요약

이 논문은 소수 클래스와 다수 클래스의 정보를 모두 활용하여 다양하고 적응형인 합성 인스턴스를 생성하는 새로운 합성 오버샘플링 방법인 SOMM을 제안한다. 양쪽 클래스의 근접 데이터를 기반으로 합성 인스턴스를 업데이트함으로써, SOMM은 균형 잡히지 않은 이진 및 다중 클래스 데이터셋에서 분류기 성능을 향상시키며, 특히 극단적인 클래스 불균형과 다중 모달성 다수 클래스 분포 상황에서 기존 방법들을 능가하는 성능을 보인다. 실험 평가에서 검증되었다.

ABSTRACT

Class imbalance is a substantial challenge in classifying many real-world cases. Synthetic over-sampling methods have been effective to improve the performance of classifiers for imbalance problems. However, most synthetic over-sampling methods generate non-diverse synthetic instances within the convex hull formed by the existing minority instances as they only concentrate on the minority class and ignore the vast information provided by the majority class. They also often do not perform well for extremely imbalanced data as the fewer the minority instances, the less information to generate synthetic instances. Moreover, existing methods that generate synthetic instances using the majority class distributional information cannot perform effectively when the majority class has a multi-modal distribution. We propose a new method to generate diverse and adaptable synthetic instances using Synthetic Over-sampling with Minority and Majority classes (SOMM). SOMM generates synthetic instances diversely within the minority data space. It updates the generated instances adaptively to the neighbourhood including both classes. Thus, SOMM performs well for both binary and multiclass imbalance problems. We examine the performance of SOMM for binary and multiclass problems using benchmark data sets for different imbalance levels. The empirical results show the superiority of SOMM compared to other existing methods.

연구 동기 및 목표

  • 기존 합성 오버샘플링 방법들이 소수 클래스에만 집중하고 다수 클래스 정보를 忽시하는 한계를 해결하기 위해.
  • 소수 클래스 인스턴스가 부족하여 효과적인 합성 생성이 어려운 극도로 불균형한 데이터셋에서의 성능 향상을 위해.
  • 다수 클래스가 복잡한 다중 모달 분포를 보일 경우에도 다양하고 적응형인 합성 인스턴스를 생성할 수 있는 방법을 개발하기 위해.
  • 소수 및 다수 클래스의 데이터 구조를 공동으로 활용하여 이진 및 다중 클래스 불균형 문제에서 분류기 성능을 향상시키기 위해.

제안 방법

  • SOMM은 수정된 SMOTE 유사 방법을 사용하여 소수 클래스 샘플의 볼록 껍질 내부에서 초기 합성 인스턴스를 생성한다.
  • 그 후, 소수 및 다수 클래스 양쪽의 국소 근접 정보를 통합하여 각 합성 인스턴스를 적응적으로 업데이트한다.
  • 합성 인스턴스의 적응적 업데이트 과정을 안내하기 위해 소수 및 다수 이웃의 거리에 가중치를 부여한 조합을 사용하여 다양성과 관련성을 확보한다.
  • 합성 인스턴스가 특성 공간의 더 대표적인 영역으로 향하도록 반복적으로 적응 업데이트를 수행한다.
  • 지역 밀도 및 분포 특성에 따라 다수 클래스 데이터의 영향력을 동적으로 조정한다.
  • 전체 다수 클래스 통계에 의존하지 않기 때문에, 다중 모달성 다수 클래스 분포에 대해 강건함을 확보하기 위해 설계되어 있다.

실험 결과

연구 질문

  • RQ1소수 및 다수 클래스 양측의 정보를 통합함으로써 합성 오버샘플링 방법이 더 나은 성능을 달성할 수 있는가?
  • RQ2다수 클래스의 국소 근접 정보 포함 여부가 불균형 데이터셋에서 합성 인스턴스의 다양성과 일반화 능력에 어떤 영향을 미치는가?
  • RQ3SOMM이 다양한 수준의 클래스 불균형 상황에서 이진 및 다중 클래스 불균형 문제에서 기존 오버샘플링 기법들을 능가하는가?
  • RQ4다수 클래스가 다중 모달성 또는 복잡한 분포 패턴을 보일 경우 SOMM의 효과성은 어떠한가?
  • RQ5합성 인스턴스의 적응적 정밀 조정이 극단적인 클래스 불균형 상황에서 분류기 성능 향상에 기여하는가?

주요 결과

  • SOMM은 F1-score 및 AUC와 같은 다양한 평가 지표에서 기존 오버샘플링 방법인 SMOTE 및 ADASYN보다 뚜렷이 뛰어난 성능을 보였다.
  • 소수 클래스 샘플이 전체의 10% 미만일 정도로 극도로 불균형한 데이터셋에서도 뛰어난 성능을 달성했다.
  • 다른 방법들이 전역 다수 클래스 통계에 의존하는 데 반해, SOMM은 다중 모달성 다수 클래스 분포에 대해 강건함을 입증했다.
  • 실험 결과, 다수 클래스의 국소 근접 정보 포함이 더 다양하고 대표적인 합성 인스턴스를 생성하는 데 기여함을 보였다.
  • 다중 클래스 불균형 문제에서는, 소수 클래스 전반에 걸쳐 일관된 성능 향상을 유지했으며, 이는 단일 대 다수 또는 쌍별 샘플링에 집중하는 방법들과는 대조된다.
  • SOMM의 적응적 업데이트 메커니즘은 테스트 세트에서 F1-score 및 AUC 값 향상으로서 일반화 능력 향상을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.