Skip to main content
QUICK REVIEW

[論文レビュー] A Method for Handling Multi-class Imbalanced Data by Geometry based Information Sampling and Class Prioritized Synthetic Data Generation (GICaPS)

Anima Majumder, Samrat Dutta|arXiv (Cornell University)|Oct 11, 2020
Imbalanced Data Classification Techniques被引用数 4
ひとこと要約

本稿では、幾何的アンダーサンプリングとクラス優先のオーバーサンプリングを組み合わせた、マルチクラスの不均衡学習のための新規なデータ処理フレームワーク、GICaPSを提案する。角制約を活用して冗長な多数クラスサンプルを除去し、クラス境界を尊重する低重複領域で合成データを生成することで、GICaPSはShuttleデータセットで平均99.39%の精度を達成し、10の不均衡データセットにおいてSMOTEやADASYNを著しく上回った。

ABSTRACT

This paper looks into the problem of handling imbalanced data in a multi-label classification problem. The problem is solved by proposing two novel methods that primarily exploit the geometric relationship between the feature vectors. The first one is an undersampling algorithm that uses angle between feature vectors to select more informative samples while rejecting the less informative ones. A suitable criterion is proposed to define the informativeness of a given sample. The second one is an oversampling algorithm that uses a generative algorithm to create new synthetic data that respects all class boundaries. This is achieved by finding \\emph{no man's land} based on Euclidean distance between the feature vectors. The efficacy of the proposed methods is analyzed by solving a generic multi-class recognition problem based on mixture of Gaussians. The superiority of the proposed algorithms is established through comparison with other state-of-the-art methods, including SMOTE and ADASYN, over ten different publicly available datasets exhibiting high-to-extreme data imbalance. These two methods are combined into a single data processing framework and is labeled as ``GICaPS'' to highlight the role of geometry-based information (GI) sampling and Class-Prioritized Synthesis (CaPS) in dealing with multi-class data imbalance problem, thereby making a novel contribution in this field.

研究の動機と目的

  • 不正検知や医療診断のようないくつかの実世界応用分野におけるマルチクラスのデータ不均衡問題に対処すること。ここでは少数クラスが重要であるが、代表されにくい。
  • SMOTE や ADASYN などの既存のサンプリング手法に見られる限界、たとえばノイズの多いサンプルを生成したり、高重複・高不均衡な状況で失敗したりする問題を克服すること。
  • 幾何的原則を用いてアンダーサンプリングとオーバーサンプリングを統合するフレームワークを構築し、情報量の多いサンプルを保持するとともに、クラス境界を尊重すること。
  • コストがかかる再重み付けやアンサンブル手法に依存せず、極端なクラス不均衡(例:10,000:1)においても分類器の性能を向上させる理論的根拠に基づいた実装可能な手法を提供すること。
  • 高不均衡から極端な不均衡に至る多様な公開データセットを用いて、本手法を検証し、最先端技術に比して一貫した優位性を示すこと。

提案手法

  • アンダーサンプリング手法は、特徴ベクトル間の角度を用いて、重複する多数クラスサンプルを特定・削除し、異なる直交座標系に位置するサンプルを保持することで、クラス分離性を維持する。
  • 多数クラスの重心からの角度偏差に基づく幾何的基準が、サンプルの情報量を定義し、情報量が少ないサンプルのみが削除されるように保証する。
  • オーバーサンプリング手法は、クラス間密度が低い領域に合成少数クラスサンプルを生成し、ユーリッド距離に基づく境界検出を用いて「誰も住まない領域」を回避する。
  • フレームワークは、少数クラス境界付近に焦点を当てたクラス優先の合成戦略を採用し、一般化性能の向上と重複の低減を図る。
  • 数学的定式化により、アンダーサンプリングのための角制約と、オーバーサンプリングのための距離ベースの「誰も住まない領域」検出を理論的根拠として提供する。
  • 両アルゴリズムの疑似コードを提示し、再現可能な実装と既存の機械学習パイプラインへの統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1特徴ベクトル間の幾何的関係を活用して、冗長な多数クラスサンプルを効果的に特定・削除し、情報量の多いサンプルを保持できるか?
  • RQ2クラス間境界の認識に基づいて合成データ生成を制御することで、重複領域で曖昧またはノイズの多いサンプルが生成されるのを防げるか?
  • RQ3幾何的アンダーサンプリングとクラス優先のオーバーサンプリングを組み合わせることで、多様で極端に不均衡なマルチクラスデータセットにおいて一貫した性能向上が得られるか?
  • RQ4実世界の不均衡データセットにおいて、GICaPSフレームワークはSMOTE、ADASYN、およびその他の最先端手法と比較して、精度、F-measure、G-meanの観点で優れているか?
  • RQ5コストセンシティブ学習やアンサンブル手法に依存せず、極端なクラス不均衡比(例:10,000:1以上)であっても、高い性能を維持できるか?

主な発見

  • Shuttleデータセットにおいて、GICaPSは全体の99.39%の精度を達成した。これはSMOTE(96.59%)やADASYN(56.27%)を著しく上回り、極端な不均衡下での優れた性能を示している。
  • Abaloneデータセットでは、GICaPS-O(オーバーサンプリングのみ)が96.80%の精度と96.32%のF-measureを達成し、SMOTE(75.71%のF-measure)やADASYN(33.5%のF-measure)を上回った。
  • Pima Indian Diabetesデータセットでは、GICaPS-Oが全体の84.15%の精度を達成し、SMOTE(76.40%)やADASYN(75.45%)を上回った。F-measureとG-meanにおいても一貫した向上が見られた。
  • Painデータセットでは、GICaPSが全体の98.80%の精度と98.79%のF-measureを達成し、SMOTE(90.33%)やADASYN(17.45%のF-measure)を著しく上回った。特に少数クラスの再現率において顕著な優位性を示した。
  • すべての評価指標において、SIMO、WSIMO、SWIM、MOCAS(NN)を一貫して上回り、GICaPSはGlass(96.7)やIonosphere(89.43)といった複数のデータセットで最高のG-meanを記録した。
  • 表VIIの統計的比較により、GICaPSはすべてのベースライン手法よりも統計的に優れており、10のベンチマークデータセットにおけるOA、F-measure、G-meanの平均性能も最高であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。