Skip to main content
QUICK REVIEW

[論文レビュー] A Study of Data Pre-processing Techniques for Imbalanced Biomedical Data Classification

Shigang Liu, Jun Zhang|arXiv (Cornell University)|Nov 4, 2019
Imbalanced Data Classification Techniques被引用数 10
ひとこと要約

本研究では、不均衡なバイオメディカルデータ分類におけるデータ前処理技術—リサンプリングと特徴量選択—の効果を、さまざまなデータ分布と分類器の下で評価する。結果として、特徴量選択とSVMの組み合わせが、特にT分布(Location-Scale)および負の二項分布に従うデータセットで最高のパフォーマンスを示すことが判明した。一方、リサンプリング手法の有効性は、分類器や不均衡比に応じて顕著に異なることがわかった。

ABSTRACT

Biomedical data are widely accepted in developing prediction models for identifying a specific tumor, drug discovery and classification of human cancers. However, previous studies usually focused on different classifiers, and overlook the class imbalance problem in real-world biomedical datasets. There are a lack of studies on evaluation of data pre-processing techniques, such as resampling and feature selection, on imbalanced biomedical data learning. The relationship between data pre-processing techniques and the data distributions has never been analysed in previous studies. This article mainly focuses on reviewing and evaluating some popular and recently developed resampling and feature selection methods for class imbalance learning. We analyse the effectiveness of each technique from data distribution perspective. Extensive experiments have been done based on five classifiers, four performance measures, eight learning techniques across twenty real-world datasets. Experimental results show that: (1) resampling and feature selection techniques exhibit better performance using support vector machine (SVM) classifier. However, resampling and Feature Selection techniques perform poorly when using C4.5 decision tree and Linear discriminant analysis classifiers; (2) for datasets with different distributions, techniques such as Random undersampling and Feature Selection perform better than other data pre-processing methods with T Location-Scale distribution when using SVM and KNN (K-nearest neighbours) classifiers. Random oversampling outperforms other methods on Negative Binomial distribution using Random Forest classifier with lower level of imbalance ratio; (3) Feature Selection outperforms other data pre-processing methods in most cases, thus, Feature Selection with SVM classifier is the best choice for imbalanced biomedical data learning.

研究の動機と目的

  • 不均衡なバイオメディカルデータ分類におけるデータ前処理の役割が十分に検討されていないことに対処すること。
  • データ分布の特性が前処理手法の有効性に与える影響を分析すること。
  • 複数の分類器と評価指標を用いて、リサンプリングおよび特徴量選択手法を体系的に評価すること。
  • 異なるデータ分布タイプと不均衡度に応じた最適な前処理戦略を同定すること。
  • 実世界のバイオメディカルデータセットにおける分類性能の向上に役立つ、根拠に基づく推奨事項を提示すること。

提案手法

  • 8種類のデータ前処理手法を評価:ランダムアンダーサンプリング、SMOTE、ADASYN、ランダムオーバーサンプリング、および4種類の特徴量選択手法。
  • 5種類の分類器を用いて適用:SVM、KNN、C4.5、LDA、ランダムフォレスト。
  • 4つの性能指標(正解率、F1スコア、AUC、G-mean)を用いてモデル性能を評価。
  • 20個の実世界のバイオメディカルデータセットを用いてテスト。これらのデータセットは、異なるクラスの不均衡比とデータ分布を有する。
  • データ分布の観点から結果を分析し、データセットをT分布(Location-Scale)、負の二項分布、その他の分布に分類。
  • すべての分類器とデータセットの組み合わせにおいて、制御された条件下で前処理手法を比較するための広範な実験を実施。

実験結果

リサーチクエスチョン

  • RQ1異なるリサンプリングおよび特徴量選択手法は、不均衡なバイオメディカルデータセットにおける分類性能にどのように影響を与えるか?
  • RQ2多様なデータ分布と分類器において、どの前処理手法が最も高いパフォーマンスを発揮するか?
  • RQ3不均衡比は、リサンプリングおよび特徴量選択手法の有効性にどのように影響を与えるか?
  • RQ4データ分布タイプと分類器選択の間には、前処理パフォーマンスにどのような相互作用効果があるか?
  • RQ5不均衡なバイオメディカル学習において、どの前処理手法と分類器の組み合わせが全体的に最高のパフォーマンスを達成するか?

主な発見

  • 特徴量選択は、大多数のデータセットと分類器において、他の前処理手法を常に上回るパフォーマンスを発揮した。
  • SVMに特徴量選択を組み合わせた手法が、特にT分布(Location-Scale)に従うデータに対して最高のパフォーマンスを示した。
  • ランダムアンダーサンプリングと特徴量選択の組み合わせが、SVMおよびKNN分類器を用いたT分布(Location-Scale)に従うデータセットで最良の結果を出した。
  • ランダムオーバーサンプリングが、負の二項分布に従うデータに対して、ランダムフォレスト分類器および低不均衡比の条件下で他のリサンプリング手法を上回った。
  • C4.5および線形判別分析分類器では、すべてのデータセットにおいてリサンプリングおよび特徴量選択が低いパフォーマンスを示した。
  • 前処理手法の有効性は、データ分布と分類器の選択の両方に強く依存していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。