Skip to main content
QUICK REVIEW

[论文解读] A study on cost behaviors of binary classification measures in class-imbalanced problems

Bao-Gang Hu, Weiming Dong|arXiv (Cornell University)|Mar 26, 2014
Imbalanced Data Classification Techniques参考文献 28被引用 22
一句话总结

本文提出一种基于代价函数的理论框架,用于评估类别不平衡问题中的二分类度量指标,揭示了诸如准确率的G-means和平衡误差率(BER)等度量表现出‘恰当’的代价行为——即对少数类误分类施加更高的代价;而F1、精确率与召回率的G-means、MCC和Kappa则不具备此类行为。本研究建立了一项元度量标准,用于识别在类别不平衡学习场景中‘恰当’的性能度量。

ABSTRACT

This work investigates into cost behaviors of binary classification measures in a background of class-imbalanced problems. Twelve performance measures are studied, such as F measure, G-means in terms of accuracy rates, and of recall and precision, balance error rate (BER), Matthews correlation coefficient (MCC), Kappa coefficient, etc. A new perspective is presented for those measures by revealing their cost functions with respect to the class imbalance ratio. Basically, they are described by four types of cost functions. The functions provides a theoretical understanding why some measures are suitable for dealing with class-imbalanced problems. Based on their cost functions, we are able to conclude that G-means of accuracy rates and BER are suitable measures because they show "proper" cost behaviors in terms of "a misclassification from a small class will cause a greater cost than that from a large class". On the contrary, F1 measure, G-means of recall and precision, MCC and Kappa coefficient measures do not produce such behaviors so that they are unsuitable to serve our goal in dealing with the problems properly.

研究动机与目标

  • 为解决在类别不平衡学习中为何某些性能度量优于其他度量的理论空白。
  • 研究随着类别不平衡比率增加,二分类度量的内在代价行为。
  • 定义并应用一项‘元度量’标准——即误分类少数类样本的代价高于误分类多数类样本的代价——以评估度量的适用性。
  • 基于其隐含的代价函数,独立于数据或算法,区分‘恰当’与‘不恰当’的度量。
  • 为无代价、类别不平衡数据的分类提供理论基础,以确定学习标准。

提出的方法

  • 本研究推导了12种二分类度量(包括F1、G-means、BER、MCC和Kappa)相对于类别不平衡比率的精确或近似代价函数。
  • 提出一种新的元度量,用于评估某一性能度量是否隐含地对少数类误分类施加更高代价。
  • 通过理论分析将度量分类为四类代价函数,其行为分为两种:‘恰当’(对少数类误分类施加更重惩罚)与‘不恰当’(对少数类错误的惩罚相等或更低)。
  • 利用具有不同不平衡比率(p2 = 0.5, 0.1, 0.01, 0.001, 0.0001, 0.00001)的合成数据构建数值示例,以验证理论发现。
  • 优先采用基于函数的评估方法,以隔离度量的内在属性,避免受数据和算法噪声的影响。
  • 通过理论代价函数分析,可在不依赖经验数据集或学习算法的前提下,比较度量之间的等价性与差异性。

实验结果

研究问题

  • RQ1为何在高度不平衡的二分类问题中,某些性能度量的表现优于其他度量?
  • RQ2随着类别不平衡比率增加,常见二分类度量的隐含代价函数是什么?
  • RQ3哪些度量本质上对少数类误分类施加更重惩罚,从而符合此类错误代价更高的原则?
  • RQ4如何定义一项元度量,以区分类别不平衡学习中‘恰当’与‘不恰当’的性能度量?
  • RQ5理论上的代价行为在多大程度上能预测不同度量在现实世界中的性能差异?

主要发现

  • 准确率的G-means和平衡误差率(BER)表现出‘恰当’的代价行为,对少数类误分类施加更高代价,因此适用于类别不平衡问题。
  • F1度量、精确率与召回率的G-means、Matthews相关系数(MCC)和Kappa系数未表现出恰当的代价行为,因此在类别不平衡学习中属于‘不恰当’度量。
  • 代价函数分析表明,BER与准确率的G-means在代价行为上理论等价,二者均满足元度量标准。
  • 数值结果证实,BER与准确率的G-means在不断增加的不平衡比率下均能保持稳定且最优的决策边界,而F1与G_PR的性能则持续下降。
  • 本研究表明,A_T(总体准确率)和F1等度量属于‘不恰当’,因为它们未能提高对少数类错误的惩罚,可能在类别不平衡设置下降低模型质量。
  • 该理论框架为选择学习标准提供了依据,且独立于数据或算法,强调在机器学习中‘学什么’才是核心问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。