Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Study on the Joint Impact of Feature Selection and Data Re-sampling on Imbalance Classification

Chongsheng Zhang, Paolo Soda|arXiv (Cornell University)|2021. 09. 01.
Imbalanced Data Classification Techniques인용 수 4
한 줄 요약

이 논문은 이원 분류 불균형 분류에서 특성 선택과 데이터 재표본 추출의 병합 영향에 대한 종합적인 실험 연구를 수행한다. 두 가지 파이프라인—재표본 추출 이전에 특성 선택을 수행하는 (FS+DS) 및 이후에 수행하는 (DS+FS) 방식을 52개 데이터셋, 9종의 특성 선택 방법, 6종의 재표본 추출 기법, 3종의 분류기에서 비교하여, 어느 파이프라인도 일관되게 우월하지 않으며, 최적의 성능을 달성하기 위해 둘 다 평가해야 한다는 점을 밝혀냈다.

ABSTRACT

In predictive tasks, real-world datasets often present different degrees of imbalanced (i.e., long-tailed or skewed) distributions. While the majority (the head) classes have sufficient samples, the minority (the tail) classes can be under-represented by a rather limited number of samples. Data pre-processing has been shown to be very effective in dealing with such problems. On one hand, data re-sampling is a common approach to tackling class imbalance. On the other hand, dimension reduction, which reduces the feature space, is a conventional technique for reducing noise and inconsistencies in a dataset. However, the possible synergy between feature selection and data re-sampling for high-performance imbalance classification has rarely been investigated before. To address this issue, we carry out a comprehensive empirical study on the joint influence of feature selection and re-sampling on two-class imbalance classification. Specifically, we study the performance of two opposite pipelines for imbalance classification by applying feature selection before or after data re-sampling. We conduct a large number of experiments, with a total of 9225 tests, on 52 publicly available datasets, using 9 feature selection methods, 6 re-sampling approaches for class imbalance learning, and 3 well-known classification algorithms. Experimental results show that there is no constant winner between the two pipelines; thus both of them should be considered to derive the best performing model for imbalance classification. We find that the performance of an imbalance classification model not only depends on the classifier adopted and the ratio between the number of majority and minority samples, but also depends on the ratio between the number of samples and features. Overall, this study should provide new reference value for researchers and practitioners in imbalance learning.

연구 동기 및 목표

  • 특성 선택과 데이터 재표본 추출이 불균형 분류 성능에 미치는 병합 영향을 조사하는 것.
  • 재표본 추출 이전에 특성 선택을 수행하는 (FS+DS)와 이후에 수행하는 (DS+FS) 두 가지 처리 파이프라인의 효과성을 비교하는 것.
  • 데이터셋 특성과 알고리즘 선택에 따라 어느 파이프라인이 더 우수한 성능을 내는지 조건을 규명하는 것.
  • 최적의 특성 선택 및 재표본 추출 방법 조합을 선택하기 위한 실용적이고 데이터 기반의 지침을 제공하는 것.
  • 클래스 불균형 학습에서 특성 선택과 재표본 추출 간의 상호보완적 영향에 대한 종합적인 실험 분 析의 부족을 보완하는 것.

제안 방법

  • 52개의 공개된 불균형 데이터셋을 대상으로 총 9,225개의 실험을 수행하였다.
  • 9종의 특성 선택 방법, 6종의 재표본 추출 기법(예: SMOTE, RUS, 조합 포함), 3종의 분류기(C4.5, SVM, MLP)를 평가하였다.
  • 두 가지 처리 파이프라인을 적용: (1) 특성 선택 후 재표본 추출 (FS+DS), (2) 재표본 추출 후 특성 선택 (DS+FS).
  • G-Mean, F1-score, IBA(향상된 균형 정확도) 등의 다수의 평가 지표를 사용하였으며, Iman-Davenport 검정을 통한 통계적 유의성 검증을 실시하였다.
  • Rank-SUM 기반 히우리스틱 Top-K 랭킹을 활용하여 데이터셋 전반에서 최고 성능을 내는 방법 조합을 식별하였다.
  • 불균형 비율(IR)과 표본 수 대 특성 수 비율(SFR)이 파이프라인 성능에 미치는 영향을 분석하였다.

실험 결과

연구 질문

  • RQ1다양한 데이터셋에서 이원 분류 불균형 분류 성능 측면에서 FS+DS 또는 DS+FS 파이프라인이 더 우수한가?
  • RQ2기본 분류기(C4.5, SVM, MLP), 재표본 추출 기법, 특성 선택 기법의 선택이 파이프라인 성능에 어떤 영향을 미치는가?
  • RQ3데이터셋의 불균형 비율(IR)과 표본 수 대 특성 수 비율(SFR)은 두 파이프라인 간 상대적 효과성에 어떤 영향을 미치는가?
  • RQ4특성 선택 및 재표본 추출 기법의 특정 조합 중에서 평가 지표 전반에서 일관되게 뛰어난 성능을 내는 조합이 존재하는가?
  • RQ5특성 선택과 재표본 추출의 순서가 불균형 학습에서 모델 일반화 및 내구성에 어느 정도 영향을 미치는가?

주요 결과

  • FS+DS 및 DS+FS 파이프라인 간 일관된 승자 없음; 최적 성능 달성을 위해 둘 다 평가해야 함.
  • 기본 분류기로 C4.5를 사용할 경우, 특히 오버샘플링 기법을 사용할 때 DS+FS 파이프라인이 G-Mean 및 F1-score 측면에서 FS+DS를 능가함.
  • SVM을 기본 분류기로 사용할 경우, 언더샘플링 기법을 사용할 땐 FS+DS가 DS+FS를 능가하지만, 오버샘플링 기법을 사용할 땐 명확한 승자 없음.
  • 불균형 비율(IR)이 높고 표본 수 대 특성 수 비율(SFR)이 낮은 데이터셋에서는 FS+DS 파이프라인이 비교 우위를 보임.
  • SFR가 높고 IR이 낮은 데이터셋에서는 어느 파이프라인도 일관되게 우세하지 않으며, 성능은 특정 데이터셋 및 방법 조합에 따라 달라짐.
  • 최고 성능을 내는 방법 조합—예: DS+FS에서 SMOTE+RS 및 Linear+RUS, FS+DS에서 ChiS+RUS 및 Ttest+RUS—는 통계적(I-man-Davenport) 및 히우리스틱(Top-K) 평가 기준 모두에서 항상 상위 3위 이내로 랭킹됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.