Skip to main content
QUICK REVIEW

[논문 리뷰] A Study of Data Pre-processing Techniques for Imbalanced Biomedical Data Classification

Shigang Liu, Jun Zhang|arXiv (Cornell University)|2019. 11. 04.
Imbalanced Data Classification Techniques인용 수 10
한 줄 요약

이 연구는 불균형 생물의학 데이터 분류에서 데이터 전처리 기법—재표본화 및 특성 선택—의 성능을 평가하며, 다양한 데이터 분포와 분류기 간의 영향을 중심으로 분석한다. 결과적으로 특성 선택과 SVM 조합이 가장 뛰어난 성능을 보였으며, 특히 T 위치-스케일 및 음이이항 분포를 가진 데이터셋에서 뚜렷하게 두각을 나타냈다. 반면 재표본화 기법의 효과는 분류기와 불균형 비율에 따라 크게 달라졌다.

ABSTRACT

Biomedical data are widely accepted in developing prediction models for identifying a specific tumor, drug discovery and classification of human cancers. However, previous studies usually focused on different classifiers, and overlook the class imbalance problem in real-world biomedical datasets. There are a lack of studies on evaluation of data pre-processing techniques, such as resampling and feature selection, on imbalanced biomedical data learning. The relationship between data pre-processing techniques and the data distributions has never been analysed in previous studies. This article mainly focuses on reviewing and evaluating some popular and recently developed resampling and feature selection methods for class imbalance learning. We analyse the effectiveness of each technique from data distribution perspective. Extensive experiments have been done based on five classifiers, four performance measures, eight learning techniques across twenty real-world datasets. Experimental results show that: (1) resampling and feature selection techniques exhibit better performance using support vector machine (SVM) classifier. However, resampling and Feature Selection techniques perform poorly when using C4.5 decision tree and Linear discriminant analysis classifiers; (2) for datasets with different distributions, techniques such as Random undersampling and Feature Selection perform better than other data pre-processing methods with T Location-Scale distribution when using SVM and KNN (K-nearest neighbours) classifiers. Random oversampling outperforms other methods on Negative Binomial distribution using Random Forest classifier with lower level of imbalance ratio; (3) Feature Selection outperforms other data pre-processing methods in most cases, thus, Feature Selection with SVM classifier is the best choice for imbalanced biomedical data learning.

연구 동기 및 목표

  • 불균형 생물의학 데이터 분류에서 데이터 전처리의 역할에 대한 미흡한 연구를 보완하기 위해.
  • 데이터 분포 특성이 전처리 기법의 효과에 미치는 영향을 분석하기 위해.
  • 여러 분류기와 성능 지표를 통해 재표본화 및 특성 선택 방법을 체계적으로 평가하기 위해.
  • 다양한 데이터 분포 유형과 불균형 수준에 적합한 최적의 전처리 전략을 규명하기 위해.
  • 실제 생물의학 데이터셋에서 분류 성능 향상을 위한 근거 기반 권고 사항을 제공하기 위해.

제안 방법

  • 무작위 언더샘플링, SMOTE, ADASYN, 무작위 오버샘플링 및 네 가지 특성 선택 방법을 포함한 여덟 가지 데이터 전처리 기법을 평가하였다.
  • SVM, KNN, C4.5, LDA, Random Forest의 다섯 가지 분류기를 적용하였다.
  • 정확도, F1 점수, AUC, G-mean의 네 가지 성능 측정 지표를 사용하여 모델 성능를 평가하였다.
  • 다양한 클래스 불균형 비율과 데이터 분포를 가진 이십개의 실세계 생물의학 데이터셋을 대상으로 테스트하였다.
  • 데이터 분포 관점에서 결과를 분석하여 데이터셋을 T 위치-스케일, 음이이항, 기타 분포로 분류하였다.
  • 모든 분류기와 데이터셋 조합에 대해 통제된 조건에서 전처리 기법을 비교하기 위해 광범위한 실험을 수행하였다.

실험 결과

연구 질문

  • RQ1다양한 재표본화 및 특성 선택 기법이 불균형 생물의학 데이터셋의 분류 성능에 어떤 영향을 미치는가?
  • RQ2다양한 데이터 분포와 분류기 간에 가장 높은 성능을 내는 전처리 기법은 무엇인가?
  • RQ3불균형 비율이 재표본화 및 특성 선택 기법의 효과성에 어떤 영향을 미치는가?
  • RQ4데이터 분포 유형과 분류기 선택 간의 상호작용 효과가 전처리 성능에 어떻게 영향을 미치는가?
  • RQ5불균형 생물의학 학습에서 전처리 기법과 분류기의 조합 중에서 가장 뛰어난 종합 성능을 내는 조합은 무엇인가?

주요 결과

  • 특성 선택은 대부분의 데이터셋과 분류기에서 다른 전처리 기법보다 뛰어난 성능을 보였다.
  • SVM과 특성 선택의 조합이 가장 높은 성능을 기록했으며, 특히 T 위치-스케일 분포를 가진 데이터에서 두각을 나타냈다.
  • 무작위 언더샘플링과 특성 선택이 SVM과 KNN 분류기에서 T 위치-스케일 분포 데이터셋에서 가장 뛰어난 성능을 보였다.
  • 무작위 오버샘플링이 Random Forest와 낮은 불균형 비율을 가진 음이이항 분포 데이터에서 다른 재표본화 기법보다 뛰어난 성능을 보였다.
  • C4.5 및 선형 판별 분석 분류기에서는 모든 데이터셋에서 재표본화 및 특성 선택이 떨어진 성능을 보였다.
  • 전처리 기법의 효과성은 데이터 분포와 분류기 선택에 모두 크게 의존하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.