Skip to main content
QUICK REVIEW

[논문 리뷰] VOS: a Method for Variational Oversampling of Imbalanced Data

Val Andrei Fajardo, David M. Findlay|arXiv (Cornell University)|2018. 09. 07.
Imbalanced Data Classification Techniques참고 문헌 11인용 수 11
한 줄 요약

이 논문은 변분 오토에인코더(VAEs)를 사용하여 소수 클래스 샘플을 합성하는 새로운 생성형 오버샘플링 방법인 VOS(Variational Oversampling)를 제안한다. 소수 클래스 데이터의 잠재 분포를 학습하고 현실적인 합성 샘플을 생성함으로써, SMOTE와 ADASYN보다 유의미하게 분류 성능을 향상시켜 사기 탐지 및 암 영상 분류 작업에서 최신 기술 수준의 F1 점수와 정밀도를 달성한다.

ABSTRACT

Class imbalanced datasets are common in real-world applications that range from credit card fraud detection to rare disease diagnostics. Several popular classification algorithms assume that classes are approximately balanced, and hence build the accompanying objective function to maximize an overall accuracy rate. In these situations, optimizing the overall accuracy will lead to highly skewed predictions towards the majority class. Moreover, the negative business impact resulting from false positives (positive samples incorrectly classified as negative) can be detrimental. Many methods have been proposed to address the class imbalance problem, including methods such as over-sampling, under-sampling and cost-sensitive methods. In this paper, we consider the over-sampling method, where the aim is to augment the original dataset with synthetically created observations of the minority classes. In particular, inspired by the recent advances in generative modelling techniques (e.g., Variational Inference and Generative Adversarial Networks), we introduce a new oversampling technique based on variational autoencoders. Our experiments show that the new method is superior in augmenting datasets for downstream classification tasks when compared to traditional oversampling methods.

연구 동기 및 목표

  • 실제 데이터셋에서 소수 클래스의 잘못된 분류가 높은 비즈니스 및 의료적 위험을 초래하는 불균형 문제를 해결하기 위해.
  • 기존 기법들인 SMOTE와 ADASYN와 비교해 더 높은 품질의 합성 소수 클래스 샘플을 생성하는 생성형 오버샘플링 방법을 개발하기 위해.
  • 변분 추론과 VAE를 사용하여 표본 수가 적은 클래스의 데이터 증강을 표본 데이터 및 이미지 데이터 모두에 적용해 보고자 하였다.
  • VOS의 효과성을 불균형 데이터셋에서 F1 점수, 정밀도, 정확도 등의 분류 지표 향상 측면에서 평가하기 위해.
  • 로지스틱 회귀, MLP, 랜덤 포레스트, CNN 등 다양한 분류기와 표본 데이터 및 이미지 데이터 등 다양한 데이터 유형에 대한 일반화 능력을 입증하기 위해.

제안 방법

  • VOS는 두 단계의 VAE 아키텍처를 사용한다: 첫 번째 인코더는 입력 특징을 잠재 공간 $ z_1 $로 매핑하고, 두 번째 인코더는 $ z_1 $를 개선된 잠재 공간 $ z_2 $로 매핑하며, 이때 목표 응답값이 $ z_2 $를 조절하는 데 사용된다.
  • 모델은 변분 추론을 사용하여 소수 클래스 데이터의 로그우도에 대한 하한을 최대화하도록 훈련되어, 생성 과정의 엔드 투 엔드 학습이 가능해진다.
  • 합성 소수 클래스 샘플은 $ z_2 $에서 학습된 사전 분포로부터 샘플링하고, 생성기 네트워크를 통해 디코딩하여 원래의 특징 공간으로 복원함으로써 생성된다.
  • 이미지 데이터의 경우, VOS가 생성한 평탄화된 벡터는 CNN 분류기로 전달되기 전에 3차원 이미지 텐서로 재구성된다.
  • 후행 훈련 중 생성된 데이터에 대한 과적합을 방지하기 위해, 표본 가중치 매개변수를 도입하였으며, 이는 합성 샘플에 대해 0.2로 설정되었다.
  • 이 방법은 다중 클래스 설정으로 확장되었으며, 로지스틱 회귀, MLP, 랜덤 포레스트, CNN 등 다양한 분류기로 테스트되었다.

실험 결과

연구 질문

  • RQ1변분 오토에인코더 기반의 생성 모델이 SMOTE와 ADASYN와 같은 기존 오버샘플링 방법보다 불균형 데이터셋에서 분류 성능 측면에서 뛰어나게 작용할 수 있는가?
  • RQ2로지스틱 회귀, MLP, 랜덤 포레스트, CNN 등 다양한 후행 분류기에서 VOS의 성능는 어떠한가?
  • RQ3사기 탐지 및 암 진단과 같은 고위험 응용 분야에서 VOS는 소수 클래스 예측의 F1 점수와 정밀도를 어느 정도 향상시키는가?
  • RQ4VAE에서 두 단계의 잠재 구조를 사용함으로써 표준 VAE에 비해 생성된 소수 클래스 샘플의 품질과 다양성이 향상되는가?
  • RQ5표본 데이터와 고차원 이미지 데이터 등 다양한 데이터 모odal에서 이 방법의 일반화 능력은 어떠한가?

주요 결과

  • 사기 탐지 데이터셋에서 VOS+LR는 F1 점수 0.852와 정밀도 0.802를 기록하여, SMOTE+LR(F1: 0.852, 정밀도: 0.105)와 ADASYN+LR(F1: 0.852, 정밀도: 0.035)를 크게 앞서며 유의미한 성능 향상을 보였다.
  • MLP 분류기의 경우, VOS+MLP는 F1 점수 0.863과 정밀도 0.830을 기록하여, SMOTE+MLP(F1: 0.852, 정밀도: 0.236)와 ADASYN+MLP(F1: 0.863, 정밀도: 0.230)를 초월하였다.
  • 랜덤 포레스트 실험에서는 VOS+RF가 F1 점수 0.773과 정밀도 0.667을 기록하였고, SMOTE+RF(F1: 0.891, 정밀도: 0.905)와 ADASYN+RF(F1: 0.878, 정밀도: 0.878)를 능가하였다. 다만, 오버샘플링 없이도 랜덤 포레스트는 유사한 성능을 보였다.
  • BreakHis 이미지 데이터셋에서 VOS+CNN은 F1 점수 0.965와 정확도 0.943을 기록하여 베이스라인 CNN(F1: 0.926, 정확도: 0.900)보다 유의미하게 향상된 성능을 보였다.
  • 로지스틱 회귀와 MLP에서 VOS의 성능 향상은 정밀도와 F1 점수에서 가장 두드러졌으며, 이는 소수 클래스의 구분 능력 향상에 기여함을 시사한다.
  • 표본 가중치(합성 데이터에 대해 0.2로 설정)를 사용한 결과에 미미한 영향을 미쳤으며, 이는 방법이 클래스 가중치 조정에 대해 강건함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.