Skip to main content
QUICK REVIEW

[논문 리뷰] Imbalanced Class Data Performance Evaluation and Improvement using Novel Generative Adversarial Network-based Approach: SSG and GBO

Md Manjurul Ahsan, Md Shahin Ali|arXiv (Cornell University)|2022. 10. 23.
Imbalanced Data Classification Techniques인용 수 6
한 줄 요약

이 논문은 기계학습에서 클래스 불균형 문제를 해결하기 위해 두 가지 새로운 GAN 기반 오버샘플링 기법—GAN 기반 오버샘플링(GBO)과 SVM-SMOTE-GAN(SSG)—을 제안한다. 생성 적대 신경망과 SVM 유도 SMOTE를 활용하여, 개선된 가우시안 분포를 가지며 오분류가 줄어든 소수 클래스의 합성 샘플을 생성함으로써, 정확도, F1 점수, 오분류 비율 측면에서 전통적인 SMOTE보다 여덟 개의 벤치마크 데이터셋에서 뛰어난 성능을 발휘한다.

ABSTRACT

Class imbalance in a dataset is one of the major challenges that can significantly impact the performance of machine learning models resulting in biased predictions. Numerous techniques have been proposed to address class imbalanced problems, including, but not limited to, Oversampling, Undersampling, and cost-sensitive approaches. Due to its ability to generate synthetic data, oversampling techniques such as the Synthetic Minority Oversampling Technique (SMOTE) is among the most widely used methodology by researchers. However, one of SMOTE's potential disadvantages is that newly created minor samples may overlap with major samples. As an effect, the probability of ML models' biased performance towards major classes increases. Recently, generative adversarial network (GAN) has garnered much attention due to its ability to create almost real samples. However, GAN is hard to train even though it has much potential. This study proposes two novel techniques: GAN-based Oversampling (GBO) and Support Vector Machine-SMOTE-GAN (SSG) to overcome the limitations of the existing oversampling approaches. The preliminary computational result shows that SSG and GBO performed better on the expanded imbalanced eight benchmark datasets than the original SMOTE. The study also revealed that the minor sample generated by SSG demonstrates Gaussian distributions, which is often difficult to achieve using original SMOTE.

연구 동기 및 목표

  • 고차원 데이터에서의 일반화 능력 부족과 합성 샘플 간의 겹침 등의 문제로 인해 전통적인 SMOTE의 한계를 해결하기 위해.
  • 생성 적대 신경망(GANs)을 활용하여 더 현실적인 합성 샘플을 생성함으로써 불균형 데이터셋에서 소수 클래스의 표현을 향상시키기 위해.
  • 더 나은 클래스 분포 특성을 가진 합성 소수 클래스 샘플을 생성함으로써 주로 클래스에 대한 모델 편향을 줄이기 위해.
  • 소수 클래스 오분류가 높은 결과를 초래하는 실제 응용 분야(의료 진단, 사기 탐지 등)에서 분류 성능을 향상시키기 위해.
  • 표준 불균형 벤치마크 데이터셋에서 제안된 방법(GBO 및 SSG)을 SMOTE 및 베이스라인 모델과 비교 평가하기 위해.

제안 방법

  • 생성자(GAN 기반 오버샘플링(GBO))를 제안함—생성자가 판별자에게 속일 수 있도록 훈련되는 GAN 아키텍처로, 데이터의 현실성 향상에 기여함.
  • SVM-SMOTE-GAN(SSG)을 도입함—SMOTE와 SVM 기반 경계 탐지, GAN 기반 생성을 융합한 하이브리드 방법으로, 더 견고하고 겹치지 않는 합성 샘플 생성에 기여함.
  • 조건부 GAN 아키텍처를 사용함—생성자는 클래스별 특성과 SVM에서 유도된 결정 경계에 조건을 두고 소수 클래스 샘플을 학습함.
  • 이중 단계 훈련 프로세스를 적용함—첫 번째 단계에서는 SVM이 결정 경계 근처의 중요한 소수 클래스 샘플을 식별하고, 두 번째 단계에서는 GAN이 이러한 점 주변에 새로운 샘플을 생성하여 일반화 능력 향상에 기여함.
  • 생성자와 판별자를 적대적 손실 및 특성 재구성 손실을 최적화하여, 생성된 샘플이 클래스 분포와 클래스 간 거리를 유지하도록 보장함.
  • 모든 데이터셋에 동일한 초모수를 설정하여 SMOTE 및 베이스라인 모델과의 공정한 비교를 확보함—다만 개별 데이터셋에 대한 초모수 튜닝은 권장됨.

실험 결과

연구 질문

  • RQ1고도로 불균형된 데이터셋에서 기존 SMOTE에 비해 GAN 기반 접근 방식이 소수 클래스 샘플의 오분류를 줄일 수 있는가?
  • RQ2SVM을 SMOTE와 GAN에 통합한 SSG는 소수 클래스와의 겹침을 줄임으로써 합성 소수 클래스 샘플의 품질을 향상시키는가?
  • RQ3제안된 방법(GBO 및 SSG)이 원래 데이터의 클래스 간 거리와 가우시안 분포를 어느 정도 유지하는가?
  • RQ4여러 벤치마크 데이터셋에서 GBO 및 SSG가 정확도, 정밀도, 재현율, F1 점수 측면에서 SMOTE와 비교해 어떻게 성능을 내는가?
  • RQ5제안된 방법들이 광범위하고 고차원적인 불균형 데이터셋에 대해 광범위하게 일반화될 수 있는가? 이 경우에 특별한 초모수 튜닝이 필수적인가?

주요 결과

  • SSG와 GBO는 여덟 개의 모든 벤치마크 데이터셋에서 SMOTE 및 원본 데이터에 비해 총 오분류(이석 + 이면)를 크게 감소시켰다.
  • Abalone 데이터셋에서 SSG가 생성한 샘플은 히스토그램 분석을 통해 SMOTE가 생성한 샘플보다 더 가우시안 분포에 가까운 분포를 보였다.
  • Abalone 데이터셋에서 SSG는 원본 데이터(122)와 SMOTE(122)에 비해 가장 낮은 오분류율(80)을 기록했다.
  • Shuttle 데이터셋에서 SSG는 원본 데이터(39)와 SMOTE(20)의 오분류를 각각 11로 감소시켜 고차원 데이터에서 뛰어난 성능을 보였다.
  • Pageblocks 데이터셋에서 SSG는 가장 낮은 오분류 수(1)와 가장 높은 F1 점수를 기록하여 SMOTE 및 GBO를 모두 압도했다.
  • 표준편차 분석 결과, SSG는 Ecoli, Winequality, Abalone, Ionosphere, Shuttle에서 원본 데이터에 가장 가까운 클래스 간 거리를 유지함을 확인하여, 더 나은 데이터 분포 충실도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.