Skip to main content
QUICK REVIEW

[论文解读] A better Beta for the H measure of classification performance

David J. Hand, Christoforos Anagnostopoulos|arXiv (Cornell University)|Feb 12, 2012
Imbalanced Data Classification Techniques参考文献 7被引用 4
一句话总结

本文提出使用 Beta(π₁+1, π₀+1) 分布作为分类性能评估中 H 指标更优的通用标准,取代先前建议的 Beta(2,2) 分布。该方法通过将成本分布与类别不平衡相匹配,确保分类器无关的性能评估,从而在类别不平衡数据集上提供更好的一致性,同时保持对称性,并在类别平衡情况下退化为 Beta(2,2)。

ABSTRACT

The area under the ROC curve is widely used as a measure of performance of classification rules. However, it has recently been shown that the measure is fundamentally incoherent, in the sense that it treats the relative severities of misclassifications differently when different classifiers are used. To overcome this, Hand (2009) proposed the $H$ measure, which allows a given researcher to fix the distribution of relative severities to a classifier-independent setting on a given problem. This note extends the discussion, and proposes a modified standard distribution for the $H$ measure, which better matches the requirements of researchers, in particular those faced with heavily unbalanced datasets, the $Beta(π_1+1,π_0+1)$ distribution. [Preprint submitted at Pattern Recognition Letters]

研究动机与目标

  • 解决 AUC 指标在分类性能评估中因类别不平衡而产生的根本性不一致问题。
  • 通过引入 H 指标,以分类器无关的方式修正相对成本分布,克服 AUC 的局限性。
  • 为 H 指标提供一个更合适、与问题相关的通用标准分布,以反映现实世界中的类别不平衡。
  • 用能适应类别先验的分布替代先前的默认 Beta(2,2) 分布,提升在类别不平衡场景下的相关性与一致性。
  • 使研究人员能够在保持原则性默认分布的同时,系统性地纳入关于误分类成本的领域知识,以实现标准化报告。

提出的方法

  • 基于 Beta(π₁+1, π₀+1) 分布,提出一种改进的 H 指标成本分布,使分布的众数定位于正类别先验 π₁。
  • 通过确保交换 π₀ 与 π₁ 时分布能正确反映对称性,强制在类别标签互换下保持成本分布的对称性,满足不变性要求。
  • 使用参数 k ≥ 3 控制众数周围的离散度,k=3 作为默认值以实现最小不确定性,同时允许专家估计的成本信念提供灵活性。
  • 允许专家提供误分类成本比 r = c/(1−c) 的估计,将其转换为众数估计 c̃ = r/(1+r),以确定 Beta 分布的参数。
  • 使用加权平均方法计算 H 指标,对不同阈值下的性能进行加权,其中成本分布作为权重,以确保不变性。
  • 证明当 π₁ = π₀ = 0.5 时,所提分布退化为 Beta(2,2),确保在类别平衡情况下与先前标准的一致性。

实验结果

研究问题

  • RQ1如何改进 H 指标,使其更准确地反映类别不平衡分类问题中误分类错误的相对严重性?
  • RQ2为何先前 H 指标的默认 Beta(2,2) 分布在类别不平衡数据集中不充分?
  • RQ3何种分布形式能同时满足在类别标签反转下的对称性要求,并与 H 指标中的类别先验正确对齐?
  • RQ4能否定义一个能适应类别不平衡、同时保持一致性和可解释性的 H 指标通用标准分布?
  • RQ5如何系统性地将关于误分类成本的领域专家知识纳入 H 指标成本分布中?

主要发现

  • 提出使用 Beta(π₁+1, π₀+1) 分布作为 H 指标比先前建议的 Beta(2,2) 更一致且更合适的通用标准。
  • 新分布确保在类别标签反转下保持对称性,满足 H 指标必须具备的分类器无关性要求。
  • 该分布以 c = π₁ 为中心,意味着误分类正样本的相对成本被设定为正类别先验概率。
  • 当 π₁ = π₀ = 0.5 时,所提分布退化为 Beta(2,2),与先前标准保持一致。
  • 参数 k 控制众数周围的离散度,k=3 为默认值,允许研究人员根据对成本估计的信心程度进行调整。
  • 该方法使研究人员能够通过众数参数系统性地纳入关于误分类成本的专家知识,提升实际相关性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。