Skip to main content
QUICK REVIEW

[論文レビュー] Improved Sampling Techniques for Learning an Imbalanced Data Set

Maureen Lyndel C Lauron, Jaderick P. Pabico|arXiv (Cornell University)|Jan 18, 2016
Imbalanced Data Classification Techniques参考文献 2被引用数 4
ひとこと要約

本稿では、不均衡な多クラスデータにおける分類器の性能を向上させるために、5つの新しいサンプリング手法—SMOTERandRep、Lax Random Oversampling (LRO)、Lax Random Undersampling (LRU)、および2つの組み合わせ手法 (C-LROU と C-LRUO)—を提案する。大学の学生データセットを用いてスタッキングCアンサンブル分類器を適用した結果、LRO、SMOTE、およびSMOTERandRepが、F-measure(0.5–0.65)およびG-mean(0.86、0.84、0.83)で最高のスコアを記録し、従来の手法やアンダーサンプリング手法を上回った。

ABSTRACT

This paper presents the performance of a classifier built using the stackingC algorithm in nine different data sets. Each data set is generated using a sampling technique applied on the original imbalanced data set. Five new sampling techniques are proposed in this paper (i.e., SMOTERandRep, Lax Random Oversampling, Lax Random Undersampling, Combined-Lax Random Oversampling Undersampling, and Combined-Lax Random Undersampling Oversampling) that were based on the three sampling techniques (i.e., Random Undersampling, Random Oversampling, and Synthetic Minority Oversampling Technique) usually used as solutions in imbalance learning. The metrics used to evaluate the classifier's performance were F-measure and G-mean. F-measure determines the performance of the classifier for every class, while G-mean measures the overall performance of the classifier. The results using F-measure showed that for the data without a sampling technique, the classifier's performance is good only for the majority class. It also showed that among the eight sampling techniques, RU and LRU have the worst performance while other techniques (i.e., RO, C-LRUO and C-LROU) performed well only on some classes. The best performing techniques in all data sets were SMOTE, SMOTERandRep, and LRO having the lowest F-measure values between 0.5 and 0.65. The results using G-mean showed that the oversampling technique that attained the highest G-mean value is LRO (0.86), next is C-LROU (0.85), then SMOTE (0.84) and finally is SMOTERandRep (0.83). Combining the result of the two metrics (F-measure and G-mean), only the three sampling techniques are considered as good performing (i.e., LRO, SMOTE, and SMOTERandRep).

研究の動機と目的

  • UPLBにおける学生の成績予測を含む学術分類タスクにおける多クラス不均衡データの課題に対処すること。
  • 多数クラスの性能を低下させることなく、少数クラスの性能を向上させること。
  • 従来の手法(RU、RO、SMOTEなど)と比較して、SMOTERandRep、LRO、LRU、C-LROU、C-LRUOの新しいサンプリング手法の有効性を評価すること。
  • F-measureおよびG-mean指標を用いて、少数クラスと多数クラスの性能のバランスが最も良いサンプリング手法を特定すること。

提案手法

  • SMOTERandRep(ランダムな複製を伴うSMOTE)、Lax Random Oversampling (LRO)、Lax Random Undersampling (LRU)、および2つの組み合わせ手法(C-LROU および C-LRUO)の5つの新しいサンプリング手法を提案した。
  • 13クラス(うち12クラスが少数クラス)を含む、2,297件の学生記録からなる実世界の多クラス不均衡データセットにこれらの手法を適用した。
  • SVM、k-NN、C4.5、CART、およびマルチレイヤーパーセプトロンを統合するスタッキングCアンサンブル分類器を用いて、全体の分類性能を向上させた。
  • モデルの評価にはストラティファイド10分割交差検証を採用し、F-measureおよびG-meanを性能指標として計算した。
  • G-meanはすべてのクラスにおける再現率の幾何平均として計算された:G-mean = (∏ᵢ₌₁ᶜ rcᵢ)^(1/c),ここで rcᵢ はクラス i の再現率を表す。
  • SMOTE、スタッキングC、およびすべての評価指標の実装にはWEKAを用い、再現可能性と標準化を確保した。

実験結果

リサーチクエスチョン

  • RQ1多クラス不均衡データにおいて、すべての少数クラスの分類器性能を最も効果的に向上させるサンプリング手法はどれか?
  • RQ2LRO、LRU、C-LROU、C-LRUO、およびSMOTERandRepといった提案手法は、RU、RO、SMOTEといった従来の手法と比較して、F-measureおよびG-meanの観点でどのように異なるか?
  • RQ3少数クラスと多数クラスの両方で高い性能を維持する観点から、オーバーサンプリングがアンダーサンプリングを上回るか?
  • RQ4一部の組み合わせサンプリング手法(例:C-LROU)は高いF-measureを示すが、G-meanは低く、クラス固有の性能と全体の性能の間でトレードオフが生じているのはなぜか?
  • RQ5提案されたLROおよびSMOTERandRep手法は、既存の最先端手法と比較して、少数クラスと多数クラスの性能のバランスを優れて達成できるか?

主な発見

  • Lax Random Oversampling (LRO) が最高のG-meanスコア(0.86)を記録し、他のすべてのサンプリング手法を上回る全体的な分類器性能を示した。
  • SMOTEはG-meanが0.84で、すべてのクラスでF-measureが0.5~0.65の間で安定しており、優れたバランスの取れた性能を示した。
  • SMOTERandRepはG-meanが0.83で、最も性能が低かったクラス(SDW)においてもF-measureが0.52を記録し、少数クラスの学習が一貫して行われたことを示した。
  • ランダムアンダーサンプリング(RU)およびLax Random Undersampling(LRU)は、多数クラスの情報損失のため、最も低いF-measureおよびG-meanスコアを記録し、最も悪かった。
  • 組み合わせ手法C-LROUは、大多数のクラスで高いF-measureを示したが、G-meanが0.85と低く、少数クラスの性能は優れていたものの多数クラスの性能が犠牲になった。
  • すべての手法の中で、LRO、SMOTE、およびSMOTERandRepのみがF-measureおよびG-meanの両方で一貫して優れた性能を示し、不均衡な多クラス学習において最も効果的であると判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。