Skip to main content
QUICK REVIEW

[論文レビュー] CGMOS: Certainty Guided Minority OverSampling

Xi Zhang, Di Ma|arXiv (Cornell University)|Jul 21, 2016
Imbalanced Data Classification Techniques参考文献 25被引用数 7
ひとこと要約

CGMOSは、少数クラスと多数クラスの両方の分類確信度を最適化することで、SMOTEに基づく新しい過剰サンプリング手法であり、理論的にSMOTEを上回る改善を保証する。6種類の分類器を用いた30個の実世界データセットにおいて優れた性能を発揮し、SMOTEより平均で2%のAUC優位性を示し、統計的に有意な向上を達成する。

ABSTRACT

Handling imbalanced datasets is a challenging problem that if not treated correctly results in reduced classification performance. Imbalanced datasets are commonly handled using minority oversampling, whereas the SMOTE algorithm is a successful oversampling algorithm with numerous extensions. SMOTE extensions do not have a theoretical guarantee during training to work better than SMOTE and in many instances their performance is data dependent. In this paper we propose a novel extension to the SMOTE algorithm with a theoretical guarantee for improved classification performance. The proposed approach considers the classification performance of both the majority and minority classes. In the proposed approach CGMOS (Certainty Guided Minority OverSampling) new data points are added by considering certainty changes in the dataset. The paper provides a proof that the proposed algorithm is guaranteed to work better than SMOTE for training data. Further experimental results on 30 real-world datasets show that CGMOS works better than existing algorithms when using 6 different classifiers.

研究の動機と目的

  • 既存のSMOTE拡張手法が理論的保証を欠くことや、多数クラスの性能を低下させる可能性があるという限界に対処すること。
  • 少数クラスと多数クラスの両方の分類確信度を体系的に向上させるデータ過剰サンプリング戦略を開発すること。
  • トレーニング中にSMOTEを上回る性能を保証する理論的根拠に基づく手法を提供すること。
  • 確信度の変化に基づくガイドラインを用いて合成サンプル生成を誘導することで、少数クラス学習における過学習とノイズ感受性を低減すること。
  • 多様な実世界データセットおよび分類器を対象とした、提案手法の頑健性と統計的有意性を評価すること。

提案手法

  • CGMOSはベイジアン分類フレームワークを用いて、多数クラスおよび少数クラスの両方の確信度スコアを計算する。
  • 両クラスの確信度を同時に向上させられる領域を特定することで、新しい合成サンプルを生成する。
  • 両クラスの確信度向上を最適化するための確信度ガイドド最適化を定式化し、どこに、どのように新しい少数クラスサンプルを合成するかを決定する。
  • SMOTEとは異なり、近隣の点をランダムに補間するのではなく、連合確信度向上を最大化するデータポイントを標的とする。
  • アルゴリズムは学習プロセスに依存せず、1ステップで動作し、反復的ブースティングやアンサンブル手法に依存しない。
  • 確信度計算から導出された確率分布を用いてサンプリングプロセスをガイドすることで、体系的かつ性能指向のデータ合成を実現する。

実験結果

リサーチクエスチョン

  • RQ1理論的保証を備えた少数クラス過剰サンプリング手法を設計でき、分類性能においてSMOTEを上回ることができるか?
  • RQ2多数クラスと少数クラスの両方の確信度を同時に最適化することで、一般化性能が向上し、過学習が低減するか?
  • RQ3AUCおよび頑健性の観点から、確信度ガイドドの合成サンプル生成は、ランダムまたは境界ベースのサンプリングと比較してどのように異なるか?
  • RQ4合成サンプル数を増加させても、CGMOSは性能を維持または向上させるか?
  • RQ5CGMOSの性能向上は、多様なデータセットおよび分類器において統計的に有意であるか?

主な発見

  • CGMOSは30個の実世界データセットにおいて、SMOTEより平均で2%高いAUCを達成し、SMOTEは2番目に高い順位を記録した。
  • 6つのテスト分類器すべてにおいて、SMOTE、Borderline-SMOTE、Adasyn、MWMOTEを含むすべてのベースラインを一貫して上回った。
  • CGMOSは優れた頑健性を示した:合成サンプル数を0.5δから5δに増加させても、性能は安定しており、他の手法よりも一貫して優れていた。
  • b-kde分類器では、CGMOSが最大の性能向上を達成し、b-kdeを用いた確信度計算との設計的一致性を裏付けた。
  • ウィルコクソン符号順位検定を用いた統計的有意性検定の結果、すべてのp値が0.05未満であり、CGMOSの優位性が統計的に有意であることが確認された。
  • ROC曲線分析において、CGMOSは全有意誤検出率レベルで最高の真正陽性率を維持し、一貫した優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。