Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Resampling Technique for Imbalanced Dataset Optimization

Ivan Letteri, Antonio Di Cecco|arXiv (Cornell University)|2020. 12. 30.
Imbalanced Data Classification Techniques참고 문헌 35인용 수 8
한 줄 요약

이 논문은 악성코드 트래픽 탐지에서 클래스 불균형 문제를 해결하기 위해 실루엣 계수 기반의 인스턴스 선택과 1-Nearest Neighbor 기반의 합성 샘플 생성을 사용하는 두 가지 새로운 오버샘플링 기법인 G1No와 G1No Gourmet을 제안한다. 이 방법들은 모든 지표에서 SMOTE와 ADASYN을 능가하며, MTA-KDD'19 데이터셋에서 99.84% 정밀도와 100.0% AUC를 달성했고, 우수한 일반화 능력과 과적합 감소를 보였다.

ABSTRACT

Despite the enormous amount of data, particular events of interest can still be quite rare. Classification of rare events is a common problem in many domains, such as fraudulent transactions, malware traffic analysis and network intrusion detection. Many studies have been developed for malware detection using machine learning approaches on various datasets, but as far as we know only the MTA-KDD'19 dataset has the peculiarity of updating the representative set of malicious traffic on a daily basis. This daily updating is the added value of the dataset, but it translates into a potential due to the class imbalance problem that the RRw-Optimized MTA-KDD'19 will occur. We capture difficulties of class distribution in real datasets by considering four types of minority class examples: safe, borderline, rare and outliers. In this work, we developed two versions of Generative Silhouette Resampling 1-Nearest Neighbour (G1Nos) oversampling algorithms for dealing with class imbalance problem. The first module of G1Nos algorithms performs a coefficient-based instance selection silhouette identifying the critical threshold of Imbalance Degree. (ID), the second module generates synthetic samples using a SMOTE-like oversampling algorithm. The balancing of the classes is done by our G1Nos algorithms to re-establish the proportions between the two classes of the used dataset. The experimental results show that our oversampling algorithm work better than the other two SOTA methodologies in all the metrics considered.

연구 동기 및 목표

  • 실제 데이터셋에서 지속적인 클래스 불균형 문제, 특히 소수의 악성 인스턴스가 희귀한 악성코드 트래픽 탐지 분야에서의 도전 과제를 해결하기 위해.
  • 고품질의 합성 소수 클래스 샘플을 생성함으로써 분류기 성능을 향상시키는 데이터 수준의 리샘플링 접근법을 개발하기 위해.
  • 데이터 복잡성과 소수 클래스 분포—특히 안전, 경계선, 희귀, 이상치 예제—가 모델의 일반화에 미치는 영향을 조사하기 위해.
  • 실루엣 계수 분석을 통합하여 더 스마트하고 강력한 샘플 생성이 가능한, 기존 SMOTE 유사 방법을 개선하기 위해.
  • 동적인 매일 업데이트되는 MTA-KDD'19 데이터셋을 기반으로 방법을 검증하여 실제 세계의 불균형 동적 환경를 시뮬레이션하기 위해.

제안 방법

  • 이 방법은 먼저 실루엣 계수 기반의 인스턴스 선택을 적용하여 잡음이 많거나 중복된 다수 클래스 샘플을 식별하고 제거하며, 불균형도(ID) 기준으로 0.3721의 임계값을 설정한다.
  • 그 후 1-Nearest Neighbor(1-NN) 접근법을 사용해 핵심 소수 클래스 예제를 식별하고, 이를 안전, 경계선, 희귀, 이상치 유형으로 분류한다.
  • 합성 소수 클래스 샘플은 SMOTE 유사 알고리즘을 사용해 생성되며, 소수 클래스 인스턴스의 볼록 Hull 내외부 모두에서 샘플을 생성함으로써 다양성을 향상시킨다.
  • G1No Gourmet 변형은 실루엣 점수를 기반으로 더 정보가 풍부한 이웃을 선택함으로써 샘플 생성 과정을 정교화하여 샘플 품질을 향상시킨다.
  • 반복적인 샘플링으로 인한 과적합을 방지하기 위해, 타겟팅된 합성 데이터 생성을 통해 데이터셋의 클래스 비율을 재균형화한다.
  • 성능 평가는 MTA-KDD'19 데이터셋에서 다층 퍼셉트론 분류기로 평가되며, SMOTE와 ADASYN과의 지표 비교를 통해 수행된다.

실험 결과

연구 질문

  • RQ1실루엣 계수 기반의 인스턴스 선택은 불균형 데이터셋에서 리샘플링 품질을 어떻게 향상시키는가?
  • RQ2소수 클래스 샘플 생성에 1-NN 기반 접근법이 일반화 능력과 강건성 측면에서 표준 SMOTE와 ADASYN을 능가할 수 있는가?
  • RQ3소수 클래스 인스턴스의 볼록 Hull 내외부에서 합성 샘플을 생성하는 것이 분류기 성능에 어떤 영향을 미치는가?
  • RQ4MTA-KDD'19 데이터셋의 동적이고 매일 업데이트되는 특성은 리샘플링 기법 평가에 어떤 영향을 미치는가?
  • RQ5기본 오버샘플링 방법에 비해 제안된 방법이 과적합과 일반화 갭을 얼마나 줄이는가?

주요 결과

  • G1No와 G1No Gourmet 알고리즘은 MTA-KDD'19 테스트 세트에서 99.84% 정밀도와 100.0% AUC를 달성했으며, SMOTE(99.52% 정밀도, 99.90% AUC)와 ADASYN(99.80% 정밀도, 99.80% AUC)을 모두 초월했다.
  • G1No Gourmet 모델은 99.70%의 정확도를 기록했으며, 원본 MTA-KDD'19 데이터셋의 보고된 정확도 99.60%를 초과했다.
  • 학습 및 검증 손실 곡선은 G1No 방법에서 최소한의 격차와 안정적인 수렴을 보였으며, 이는 강력한 일반화 능력과 과적합 없음을 시사했고, SMOTE와 ADASYN와는 대조적으로 나타났다.
  • ADASYN 방법은 10번째 에포크 이후에도 학습 손실 감소 경향을 보였으며, 이는 조기 정지와 과소적합을 시사했고, G1No 모델는 조기에 안정화되어 최적의 성능을 달성했다.
  • G1No 알고리즘은 소수 클래스 인스턴스의 볼록 Hull을 초월해 샘플을 생성함으로써 더 풍부한 구조적 다양성을 확보했으며, 이는 모델의 강건성 향상에 기여했다.
  • 상관관계 분석 결과, 네 가지 방법이 생성한 합성 샘플 간에 의미 있는 특성 수준의 차이가 확인되었으며, G1No는 더 일관되고 정보가 풍부한 인스턴스를 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.