Skip to main content
QUICK REVIEW

[論文レビュー] Towards Competitive Classifiers for Unbalanced Classification Problems: A Study on the Performance Scores

Jonathan Ortigosa-Hernández, Iñaki Inza|arXiv (Cornell University)|Aug 31, 2016
Imbalanced Data Classification Techniques参考文献 25被引用数 4
ひとこと要約

本稿は、不均衡分類問題における性能スコアの評価のための理論的枠組みを提案し、$p \leq 1$(例:a-mean、g-mean)の重みなし Hölder 平均が分類器の競争力を評価するのに最適であることを示している。既存の学習手法の多くが暗黙的に a-mean ($p=1$) を最大化していることを示し、不均衡な状況下でも任意のクラスにおいて競争的な性能を達成するための実用的境界を導出している。

ABSTRACT

Although a great methodological effort has been invested in proposing competitive solutions to the class-imbalance problem, little effort has been made in pursuing a theoretical understanding of this matter. In order to shed some light on this topic, we perform, through a novel framework, an exhaustive analysis of the adequateness of the most commonly used performance scores to assess this complex scenario. We conclude that using unweighted Hölder means with exponent $p \leq 1$ to average the recalls of all the classes produces adequate scores which are capable of determining whether a classifier is competitive. Then, we review the major solutions presented in the class-imbalance literature. Since any learning task can be defined as an optimisation problem where a loss function, usually connected to a particular score, is minimised, our goal, here, is to find whether the learning tasks found in the literature are also oriented to maximise the previously detected adequate scores. We conclude that they usually maximise the unweighted Hölder mean with $p = 1$ (a-mean). Finally, we provide bounds on the values of the studied performance scores which guarantee a classifier with a higher recall than the random classifier in each and every class.

研究の動機と目的

  • 不均衡なクラス分布における分類器の競争力評価に理論的に適切な性能スコアを特定すること。
  • スプライスデータ向けに設計された既存の学習ソリューションが実際に最大化する性能スコア(損失関数)を調査すること。
  • 不均衡な状況下で、すべてのクラスにおいてランダム予測を上回る性能を達成する分類器を保証する実用的境界を導出すること。
  • 重なりやノイズ要因を制御することで、クラス分布が性能スコアに与える影響を分離すること。
  • 多クラスで極めて不均衡な問題における分類器の評価と改善のための理論的根拠に基づいた枠組みを提供すること。

提案手法

  • 重なりやノイズ要因を排除することで、クラス分布の影響を分離する新しい制御された分類フレームワークを構築する。
  • クラス確率の変化に伴う性能スコアの挙動を分析するため、ベイズ意思決定ルール(BDR)を基準分類器として用いる。
  • 主要な性能スコアを指数 $p$ でパrameter化されたクラス再現率の重みなし Hölder 平均として表現する。
  • 特に $p \leq 1$ の場合に少数クラスの評価がバランスよくなるように、スコアのクラス分布への感受性を分析する。
  • Hölder 平均の解析的境界を $p \in \mathbb{R} \cup \{+\infty, -\infty\}$ に対して導出し、競争的・非競争的性能を定義する。
  • 既存の学習アルゴリズムをその背後にある最適化目的にマッピングし、それらが通常 a-mean ($p=1$) を最大化していることを示す。

実験結果

リサーチクエスチョン

  • RQ1不均衡な多クラス問題における分類器の競争力評価に理論的に適切な性能スコアは何か?
  • RQ2スプライスデータ向けに開発された代表的な学習ソリューションが実際に最適化する性能スコア(損失関数)は何か?
  • RQ3分類器がすべてのクラスにおいてランダム分類器を上回る再現率を達成することを保証する解析的境界を導出できるか?
  • RQ4他の混同要因(例:重なり、ノイズ)を除去した場合、クラス分布が性能スコアの値にどのように影響を与えるか?
  • RQ5既存の手法が暗黙的に a-mean を最適化している程度はどの程度で、この選択は理論的に正当化されるか?

主な発見

  • クラス再現率の重みなし Hölder 平均で $p \leq 1$ のものは、不均衡な問題における分類器の競争力評価に最も適切な性能スコアである。
  • a-mean ($p=1$) は、既存の学習ソリューションで最も一般的に最適化されるスコアであり、同確率クラス下でこれらの手法がベイズ意思決定ルールに漸近的に収束するためである。
  • スコアが $p < 1$ の場合、少数クラスの誤分類に対するペナルティが強く、不均衡への感受性が高くなるため、公平性評価に適している。
  • 本研究では、競争的性能を保証する最小スコア値を示す境界と、非競争的性能を示す最大値を示す境界の2つを実用的に導出した。
  • フレームワークはクラス分布の影響を効果的に分離でき、$p \leq 1$ の Hölder 平均が分類器のバランスの指標として頑健であることを確認した。
  • 結果から、現在の学習システムは理論的に a-mean の最大化に整合しているが、少数クラスへの強調を高めるためにより低い $p$ 値を標的とすることで、さらなる改善の余地があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。