Skip to main content
QUICK REVIEW

[论文解读] Calibrated Surrogate Maximization of Linear-fractional Utility in Binary Classification

Han Bao, Masashi Sugiyama|arXiv (Cornell University)|May 29, 2019
Machine Learning and Algorithms参考文献 48被引用 4
一句话总结

本文提出一种校准后的代理效用函数,用于在二分类中直接最大化线性分式性能度量(如Fβ度量和Jaccard指数)。通过构建满足充分校准条件的可处理下界,该方法实现了高效的基于梯度的优化,并确保统计一致性,在小样本情形下优于插补法。

ABSTRACT

Complex classification performance metrics such as the F${}_β$-measure and Jaccard index are often used, in order to handle class-imbalanced cases such as information retrieval and image segmentation. These performance metrics are not decomposable, that is, they cannot be expressed in a per-example manner, which hinders a straightforward application of M-estimation widely used in supervised learning. In this paper, we consider linear-fractional metrics, which are a family of classification performance metrics that encompasses many standard ones such as the F${}_β$-measure and Jaccard index, and propose methods to directly maximize performances under those metrics. A clue to tackle their direct optimization is a calibrated surrogate utility, which is a tractable lower bound of the true utility function representing a given metric. We characterize sufficient conditions which make the surrogate maximization coincide with the maximization of the true utility. Simulation results on benchmark datasets validate the effectiveness of our calibrated surrogate maximization especially if the sample sizes are extremely small.

研究动机与目标

  • 解决在类别不平衡的二分类中优化非可分解性能度量(如Fβ和Jaccard指数)的挑战。
  • 克服传统M估计法因这些度量不可分解而带来的局限性。
  • 开发一种模型无关、计算高效的直接最大化效用的方法,无需迭代微调或高样本后验概率估计。
  • 通过Z估计理论确保经验估计量的统计一致性。
  • 提供充分的校准条件,使代理最大化与真实效用最大化一致。

提出的方法

  • 引入一种校准后的代理效用函数,作为真实线性分式效用函数的可处理下界。
  • 将优化问题表述为两步法,结合凹规划与拟凹规划以提升计算效率。
  • 推导代理校准的充分条件,以保证代理最大化器与真实效用最大化器一致。
  • 由于其非零梯度和无偏梯度估计器,对代理函数采用基于梯度的优化方法(U-GD和U-BFGS)。
  • 应用Z估计理论,在有限样本下建立经验估计量的一致性。
  • 采用分样本方法,使用$\mathcal{S}_0$估计代理函数,使用$\mathcal{S}_1$进行优化,以减少偏差。

实验结果

研究问题

  • RQ1能否构建一种校准后的代理效用函数,以实现在二分类中直接最大化线性分式度量?
  • RQ2在何种条件下,最大化代理效用函数的结果与最大化真实效用函数的结果一致?
  • RQ3与插补法和迭代微调方法相比,所提方法在计算效率和样本复杂度方面表现如何?
  • RQ4校准参数$\tau$对性能有何影响,特别是在小样本情形下?
  • RQ5随着样本量增大,基于代理方法的经验估计量是否具有统计一致性?

主要发现

  • 在样本量较小时(如20–40),所提出的校准代理最大化方法在F1和Jaccard得分上优于插补法,尤其在cod-rna、diabetes和ionosphere等数据集上表现更优。
  • 即使在样本量为100–400时,基于梯度的方法(U-GD和U-BFGS)也优于插补法,这与全样本数据集上的结果相反,后者可能显示插补法占优。
  • 当$\tau$趋近于1时,多数度量和数据集的性能均有所提升,但存在极值点,表明性能对$\tau$的选择较为敏感。
  • 理论分析证实,在所提出的校准条件下,经验估计量具有一致性,确保收敛至真实效用最大化器。
  • 该方法具有模型无关性,避免了后验概率估计的高样本复杂度以及迭代微调带来的计算负担。
  • 在小样本情形下,代理方法为插补法提供了可靠的替代方案,后者因概率估计不佳而失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。