Skip to main content
QUICK REVIEW

[論文レビュー] Metrics for Multi-Class Classification: an Overview

Margherita Grandini, E. Bagli|arXiv (Cornell University)|Aug 13, 2020
Machine Learning in Bioinformatics参考文献 9被引用数 66
ひとこと要約

このホワイトペーパーは、多クラス分類の性能指標を総覧し、それらの定義・利点・欠点・モデル評価と開発のための適用例を詳述します。

ABSTRACT

Classification tasks in machine learning involving more than two classes are known by the name of "multi-class classification". Performance indicators are very useful when the aim is to evaluate and compare different classification models or machine learning techniques. Many metrics come in handy to test the ability of a multi-class classifier. Those metrics turn out to be useful at different stage of the development process, e.g. comparing the performance of two different models or analysing the behaviour of the same model by tuning different parameters. In this white paper we review a list of the most promising multi-class metrics, we highlight their advantages and disadvantages and show their possible usages during the development of a classification model.

研究の動機と目的

  • 有望な多クラス評価指標の幅広いセットをレビューする。
  • 各指標の利点と欠点を強調する。
  • 指標を分類モデルの開発と調整にどのように活用できるかを示す。
  • クラスのバランスが指標の選択と解釈に与える影響を説明する。

提案手法

  • 議論を混同行列ベースの指標とその拡張に根ざさせる。
  • Accuracy、Balanced Accuracy、Balanced Accuracy Weightedを提示・定義する。
  • Binaryおよび多クラス設定におけるF1-Scoreを、MacroおよびMicroバリアントを含めて説明する。
  • Cross-Entropyを分布ベースの評価指標として紹介する。
  • 独立性ベースの指標(Matthews Correlation CoefficientとCohen’s Kappa)とそれらの多クラス拡張について論じる。
  • 実践的な解釈、長所/短所、指標選択の指針を提供する。

実験結果

リサーチクエスチョン

  • RQ1多クラス分類器を評価する際の主要な指標は何で、それらは解釈の点でどう異なるか。
  • RQ2Macro-およびMicro平均が、特にクラス不均衡下で多クラスの性能評価にどのように影響するか。
  • RQ3MCCやCohen’s Kappaのような代替指標が、標準のAccuracyやF1スコアより望ましいのはどんな場合か。
  • RQ4Cross-Entropyが分類性能とどのように関連し、評価におけるその制限は何か。

主な発見

  • Accuracyはデータセット全体の測度で、正しく分類された単位と誤って分類された単位を合算する。
  • Balanced Accuracyは各クラスのリコールを平均化し、クラス不均衡の影響を緩和する。
  • Balanced Accuracy Weightedはクラス頻度を取り入れて各クラスのリコールをバランスさせる。
  • F1-ScoreはPrecisionとRecallを調和平均で結合し、多クラス評価のためにMacroおよびMicroバリアントを持つ。
  • Macro F1はすべてのクラスを等しく扱い、Micro F1は全体のAccuracyと一致する;それぞれ解釈が異なる。
  • Cross-Entropyは決定規則の品質より分布の類似性を評価し、計算的に高速である。
  • Matthews Correlation CoefficientとCohen’s Kappaは依存/一致の概念を多クラスへ拡張し、TNと偶然一致を考慮する。これらはバランスのとれた評価を提供し、不均衡な設定では単純なAccuracyを上回ることがある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。