Skip to main content
QUICK REVIEW

[论文解读] Proper likelihood ratio based ROC curves for general binary classification problems

Lidia Sacchetto, Mauro Gasparini|arXiv (Cornell University)|Sep 3, 2018
Advanced Statistical Methods and Models参考文献 21被引用 3
一句话总结

本文提出基于似然比(LR)的ROC曲线,作为二分类中传统经验ROC曲线的理论最优替代方案。通过推导适用于多种数据类型(包括离散、连续和复杂数据)的通用似然比分类框架,证明了基于似然比的ROC曲线在本质上是凹的、非递减的,并且在Neyman-Pearson引理下是最优的,因此相较于标准经验估计,尤其在多变量和非参数设置下,提供了更可靠、更高效的替代方案。

ABSTRACT

Everybody writes that ROC curves, a very common tool in binary classification problems, should be optimal, and in particular concave, non-decreasing and above the 45-degree line. Everybody uses ROC curves, theoretical and especially empirical, which are not so. This work is an attempt to correct this schizophrenic behavior. Optimality stems from the Neyman-Pearson lemma, which prescribes using likelihood-ratio based ROC curves. Starting from there, we give the most general definition of a likelihood-ratio based classification procedure, which encompasses finite, continuous and even more complex data types. We point out a strict relationship with a general notion of concentration of two probability measures. We give some nontrivial examples of situations with non-monotone and non-continuous likelihood ratios. Finally, we propose the ROC curve of a likelihood ratio based Gaussian kernel flexible Bayes classifier as a proper default alternative to the usual empirical ROC curve.

研究动机与目标

  • 解决广泛使用不恰当、非凹且非单调的经验ROC曲线的问题,这些曲线缺乏理论最优性。
  • 建立一个通用的、数学上严谨的似然比分类定义,适用于任意数据类型,包括有限型、连续型和复杂数据。
  • 证明基于似然比的ROC曲线本质上是恰当的——即凹的、非递减的,并位于45度线之上,从而满足由Neyman-Pearson引理推导出的最优性质。
  • 提供一种实用的非参数替代方法,采用高斯核灵活贝叶斯分类器,生成平滑、恰当的ROC曲线,优于阶梯状的经验估计。
  • 指出QDA和线性判别分析等常用方法在多变量设置下的局限性,并表明基于似然比的方法在理论性能上全面优于这些方法。

提出的方法

  • 推导适用于任意数据空间的通用似然比分类规则,前提是两种总体测度彼此绝对连续。
  • 将ROC曲线定义为参数轨迹 (FPR(t), TPR(t)),其中决策规则基于对似然比的阈值处理。
  • 建立似然比与广义集中函数概念之间的联系,将分类问题与测度论概念相连接。
  • 将该方法应用于真实世界的前列腺癌诊断案例研究,使用microRNA和PSA数据,比较参数方法(QDA)与非参数方法(灵活贝叶斯)。
  • 使用算法5.1通过高斯核灵活贝叶斯分类器估计非参数似然比ROC曲线,避免了经验方法的阶梯状伪影。
  • 将所得ROC曲线与标准经验估计(例如通过R库Sing S2005)进行比较,以证明其在平滑性和效率方面的优越性。

实验结果

研究问题

  • RQ1能否为包括离散型、连续型和复杂数据在内的任意数据类型,定义一个通用的基于似然比的分类框架?
  • RQ2为何传统经验ROC曲线常常不恰当(非凹、非单调)?其更优替代方案的理论基础是什么?
  • RQ3在多变量设置下,基于似然比的ROC曲线与QDA、线性判别分析和逻辑回归等标准方法相比,性能如何?
  • RQ4似然比的非参数估计能否产生比标准经验阶梯状估计更平滑、更凹且更高效的ROC曲线?
  • RQ5在两个概率测度的背景下,似然比与集中函数之间存在何种关系?

主要发现

  • 基于似然比的ROC曲线在本质上是凹的且非递减的,即使似然比本身不是单调的,也能满足由Neyman-Pearson引理导出的最优性质。
  • 所提出的方法生成的ROC曲线始终位于45度线之上,且在理论上优于常用的经验和参数ROC曲线。
  • 在前列腺癌案例研究中,基于似然比估计的非参数灵活贝叶斯分类器生成了平滑、凹的ROC曲线,其效率高于阶梯状的经验ROC曲线。
  • 灵活贝叶斯分类器的似然比ROC曲线平均而言低于QDA曲线,反映出通用性与性能之间的权衡,但在估计效率和平滑性方面仍占优势。
  • 理论分析证实,只要测度彼此绝对连续,基于似然比的分类在一般条件下即为最优,且不依赖于数据类型。
  • 本研究表明,经验ROC曲线的常用使用方式存在次优性,而基于似然比的恰当、平滑且凹的ROC曲线在理论上成立且在实践中可实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。