Skip to main content
QUICK REVIEW

[논문 리뷰] Effective Class-Imbalance learning based on SMOTE and Convolutional Neural Networks

Javad Hasannataj Joloudari, Abdolreza Marefat|arXiv (Cornell University)|2022. 09. 01.
Imbalanced Data Classification Techniques인용 수 8
한 줄 요약

이 논문은 이진 분류에서 클래스 불균형 문제를 해결하기 위해 SMOTE 오버샘플링과 컨볼루션 신경망(CNNs)을 조합한 하이브리드 딥러닝 접근법을 제안한다. SMOTE를 정규화 및 CNN 학습과 통합함으로써, 24개의 불균형 데이터셋에서 99.08%의 정확도를 달성하였으며, 기준 기법들보다 뚜렷이 뛰어나다.

ABSTRACT

Imbalanced Data (ID) is a problem that deters Machine Learning (ML) models for achieving satisfactory results. ID is the occurrence of a situation where the quantity of the samples belonging to one class outnumbers that of the other by a wide margin, making such models learning process biased towards the majority class. In recent years, to address this issue, several solutions have been put forward, which opt for either synthetically generating new data for the minority class or reducing the number of majority classes for balancing the data. Hence, in this paper, we investigate the effectiveness of methods based on Deep Neural Networks (DNNs) and Convolutional Neural Networks (CNNs), mixed with a variety of well-known imbalanced data solutions meaning oversampling and undersampling. To evaluate our methods, we have used KEEL, breast cancer, and Z-Alizadeh Sani datasets. In order to achieve reliable results, we conducted our experiments 100 times with randomly shuffled data distributions. The classification results demonstrate that the mixed Synthetic Minority Oversampling Technique (SMOTE)-Normalization-CNN outperforms different methodologies achieving 99.08% accuracy on the 24 imbalanced datasets. Therefore, the proposed mixed model can be applied to imbalanced binary classification problems on other real datasets.

연구 동기 및 목표

  • 소수 클래스가 부족하여 모델이 다수 클래스 쪽으로 편향되는 클래스 불균형 문제를 다루는 것.
  • 특히 CNN을 포함한 딥러닝 모델과 SMOTE와 같은 데이터 수준 기법을 조합하여 불균형 데이터를 처리하는 데의 효과성을 조사하는 것.
  • 다양한 실제 데이터셋에서 오버샘플링(SMOTE)과 정규화를 CNN과 통합한 하이브리드 방법의 성능을 평가하는 것.
  • 다양한 실행 및 데이터셋에서 일관되고 높은 정확도를 보이며, 제안된 방법의 신뢰성과 일반화 능력을 입증하는 것.

제안 방법

  • 소수 클래스를 위한 합성 샘플을 생성하기 위해 합성 소수 클래스 오버샘플링 기법(SMOTE)을 적용하여 데이터 균형을 향상시킨다.
  • CNN 모델의 학습 동역학을 안정화하고 향상시키기 위해 데이터 정규화 기법을 통합한다.
  • 불균형 데이터로부터 강력하고 계층적인 특징을 학습하기 위해 증강된 데이터셋 위에 컨볼루션 신경망(CNN)을 학습시킨다.
  • SMOTE, 정규화 및 CNN을 통합하여 통합된 파이프라인을 구축함으로써 모델의 일반화 능력을 향상시키는 혼합 방법론을 개발한다.
  • 모든 실험에서 데이터 분포를 100번의 무작위 셔플링을 통해 통계적 신뢰성 확보 및 결과의 분산 감소를 도모한다.
  • KEEL, 유방암, Z-Alizadeh Sani 등 다양한 벤치마크 데이터셋을 사용하여 표준 분류 지표를 기반으로 성능을 평가한다.

실험 결과

연구 질문

  • RQ1SMOTE와 CNN의 조합이 불균형 데이터셋에서 분류 정확도 향상에 얼마나 효과적인가?
  • RQ2정규화를 SMOTE 및 CNN과 통합함으로써 더 안정적이고 신뢰할 수 있는 모델 성능이 달성되는가?
  • RQ3제안된 SMOTE-정규화-CNN 모델은 다양한 데이터셋에서 기존의 다른 방법들에 비해 클래스 불균형 문제 처리에 얼마나 우수한가?
  • RQ4제안된 방법은 다양한 종류의 불균형 이진 분류 문제에 일반화 가능한가?
  • RQ5데이터의 반복적인 무작위 셔플링이 모델 성능의 일관성과 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • SMOTE-정규화-CNN 모델은 24개의 불균형 데이터셋에서 평균 99.08%의 분류 정확도를 달성하였으며, 다른 기준 기법들보다 뚜렷이 뛰어나다.
  • 제안된 방법은 매우 높은 일관성과 신뢰성을 보였으며, 결과는 100번의 무작위 데이터 셔플링 평균을 통해 분산을 최소화하였다.
  • SMOTE를 정규화 및 CNN과 통합함으로써 학습 동역학이 향상되고 다수 클래스 쪽으로의 편향이 감소하였다.
  • KEEL, 유방암, Z-Alizadeh Sani 등 다양한 실제 데이터셋에서 강력한 일반화 능력을 보였다.
  • 데이터 수준의 증강(SMOTE)과 딥러닝(CNNs)을 조합한 하이브리드 접근법이 불균형 이진 분류에 매우 효과적임을 확인하였다.
  • 다른 구성 요소들과 비교했을 때 제안된 방법이 뛰어나므로, SMOTE를 적절한 데이터 전처리 및 딥러닝 아키텍처와 함께 조합하는 것이 중요하다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.