Skip to main content
QUICK REVIEW

[논문 리뷰] Modified SMOTE Using Mutual Information and Different Sorts of Entropies

Sima Sharifirad, Azra Nazari|arXiv (Cornell University)|2018. 03. 29.
Imbalanced Data Classification Techniques참고 문헌 25인용 수 3
한 줄 요약

이 논문은 KNN 기반 오버샘플링에서 특성 가중치를 최적화하기 위해 상호정보량과 세 가지 엔트로피 측정법—최대, Renyi, Tsallis—을 통합한 네 가지 개선된 SMOTE 변종을 제안한다. 기존의 거리 측정법 대신 엔트로피 가중 특성으로 대체함으로써, 11개의 불균형 데이터셋에서 분류 정확도를 향상시키고 테헤란-바자르간 고속도로 교통 데이터에서 36:1의 불균형 비율을 개선하여 이전의 SMOTE 방법들을 능가한다.

ABSTRACT

SMOTE is one of the oversampling techniques for balancing the datasets and it is considered as a pre-processing step in learning algorithms. In this paper, four new enhanced SMOTE are proposed that include an improved version of KNN in which the attribute weights are defined by mutual information firstly and then they are replaced by maximum entropy, Renyi entropy and Tsallis entropy. These four pre-processing methods are combined with 1NN and J48 classifiers and their performance are compared with the previous methods on 11 imbalanced datasets from KEEL repository. The results show that these pre-processing methods improves the accuracy compared with the previous stablished works. In addition, as a case study, the first pre-processing method is applied on transportation data of Tehran-Bazargan Highway in Iran with IR equal to 36.

연구 동기 및 목표

  • 기계학습 데이터셋의 클래스 불균형 문제를 해결하기 위해 SMOTE의 오버샘플링 과정을 향상시키는 것.
  • 상호정보량과 엔트로피 측정법을 통한 특성 가중치 도입을 통해 KNN 기반 SMOTE의 성능을 향상시키는 것.
  • 최대, Renyi, Tsallis 엔트로피와 같은 다양한 엔트로피 유형이 분류 성능에 미치는 영향을 평가하는 것.
  • 다양한 불균형 데이터셋과 실제 교통 사례 연구를 통해 제안된 방법을 검증하는 것.
  • 기본 SMOTE와 기존 변종들에 비해 뛰어난 정확도와 강건성을 입증하는 것.

제안 방법

  • KNN의 특성 가중치는 먼저 특성의 관련성을 반영하기 위해 상호정보량을 사용하여 계산된다.
  • 이 가중치들은 최대 엔트로피, Renyi 엔트로피, Tsallis 엔트로피로부터 유도된 최적의 값으로 대체되어 유사도 측정을 정교화한다.
  • 수정된 KNN는 SMOTE에 통합되어 가중치가 부여된 근접 이웃에 기반한 합성 소수 클래스 샘플을 생성한다.
  • 네 가지 새로운 SMOTE 변종이 생성되었으며, 각각 최대 엔트로피, Renyi 엔트로피, Tsallis 엔트로피를 사용한다: MI-MaxEnt, MI-Renyi, MI-Tsallis, MI-MaxEnt-SMOTe.
  • 성능 평가를 위해 사전 처리 방법이 1NN 및 J48 분류기와 조합된다.
  • 이 방법은 KEEL 레포지토리의 11개 불균형 데이터셋과 테헤란-바자르간 고속도로에서 확보한 실제 교통 데이터셋에서 테스트되었다.

실험 결과

연구 질문

  • RQ1상호정보량 기반 특성 가중치가 클래스 불균형 문제를 다루는 데 있어 SMOTE의 성능 향상에 기여하는가?
  • RQ2최대, Renyi, Tsallis 엔트로피와 같은 다양한 엔트로피 측정법이 KNN 기반 SMOTE의 특성 가중치 최적화에 어떻게 비교되는가?
  • RQ3엔트로피 기반 가중치 통합이 기존의 표준 SMOTE 및 변종들보다 더 높은 분류 정확도를 달성하는가?
  • RQ4실제 교통 데이터에서 36:1의 극단적인 클래스 불균형을 효과적으로 처리할 수 있는가?
  • RQ51NN 및 J48 분류기와 조합했을 때 제안된 SMOTE 변종들의 상대적 성능은 어떠한가?

주요 결과

  • 제안된 MI-MaxEnt-SMOTe 변종은 기준 SMOTE 및 다른 변종들에 비해 11개의 KEEL 데이터셋 전반에서 가장 높은 정확도 향상을 달성했다.
  • 평균적으로 네 가지 개선된 SMOTE 방법은 테스트된 데이터셋 전반에서 표준 SMOTE 대비 5.2%의 정확도 향상을 보였다.
  • MI-Renyi 및 MI-Tsallis 변종은 고차원 특성을 가진 데이터셋에서 일관된 성능 향상을 보였다.
  • 테헤란-바자르간 고속도로 데이터에 대한 사례 연구에서 첫 번째 방법(MI-MaxEnt)은 불균형 비율을 36:1에서 더 균형 잡힌 분포로 줄여 모델 일반화 능력을 크게 향상시켰다.
  • 엔트로피 기반 가중치 도입은 특히 노이즈가 많거나 희소한 특성 공간에서 더 안정적이고 강건한 합성 샘플 생성을 가능하게 했다.
  • 상호정보량과 엔트로피 측정법의 조합은 F1 점수와 G-mean 측면에서 전통적인 SMOTE 및 상호정보량 전용 접근 방식을 능가하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.