[论文解读] Binary Classification with Bounded Abstention Rate
本文提出了一种新型的即插即用分类器,用于二分类任务,其拒绝率受约束,通过数据驱动的自适应方法确保高概率满足拒绝约束。该方法在无需连续性假设的前提下推导出贝叶斯最优分类器,建立了在光滑性和边界条件下的过失风险上界,并提出了一种计算高效的基于凸损失的算法,具有极小化最大误差的近似最优性保证,其有效性在UCI数据集上得到了实证验证。
We consider the problem of binary classification with abstention in the relatively less studied \emph{bounded-rate} setting. We begin by obtaining a characterization of the Bayes optimal classifier for an arbitrary input-label distribution $P_{XY}$. Our result generalizes and provides an alternative proof for the result first obtained by \cite{chow1957optimum}, and then re-derived by \citet{denis2015consistency}, under a continuity assumption on $P_{XY}$. We then propose a plug-in classifier that employs unlabeled samples to decide the region of abstention and derive an upper-bound on the excess risk of our classifier under standard \emph{Hölder smoothness} and \emph{margin} assumptions. Unlike the plug-in rule of \citet{denis2015consistency}, our constructed classifier satisfies the abstention constraint with high probability and can also deal with discontinuities in the empirical cdf. We also derive lower-bounds that demonstrate the minimax near-optimality of our proposed algorithm. To address the excessive complexity of the plug-in classifier in high dimensions, we propose a computationally efficient algorithm that builds upon prior work on convex loss surrogates, and obtain bounds on its excess risk in the \emph{realizable} case. We empirically compare the performance of the proposed algorithm with a baseline on a number of UCI benchmark datasets.
研究动机与目标
- 在任意输入-标签分布下,对具有有界拒绝率的二分类问题,刻画贝叶斯最优分类器,且无需连续性假设。
- 设计一种即插即用分类器,通过使用未标记样本自适应地控制拒绝率,并在高概率下满足拒绝率约束,同时处理经验累积分布函数中的不连续性。
- 在标准Hölder光滑性和边界条件下,推导过失风险的上界,并通过下界建立极小化最大误差的近似最优性。
- 提出一种基于凸损失代理的计算高效算法,适用于高维设置,并在可实现情况下提供理论上的过失风险上界。
- 在多个UCI基准数据集上,对所提方法与基线方法进行实证评估,展示其在不同拒绝率下的性能表现。
提出的方法
- 通过推广Chow(1957)的基于阈值的规则,推导出具有有界拒绝率的贝叶斯最优分类器,提供一种替代证明,放宽了对连续性的假设要求。
- 构建一种即插即用分类器,利用未标记数据估计拒绝区域,采用随机化规则以确保在高概率下满足拒绝率约束。
- 在Hölder光滑性和边界条件下,建立过失风险的上界,利用对未知光滑性参数的局部自适应性。
- 提出一种基于广义合页损失的凸损失算法,以降低高维情况下的计算复杂度,并在可实现情况下提供理论上的过失风险上界。
- 利用Rademacher复杂度和泛化界控制拒绝率,引入松弛项以确保约束的高概率满足。
- 采用随机化阈值规则和截断合页损失,以确保在有限样本下对拒绝率的鲁棒性和紧密控制。
实验结果
研究问题
- RQ1在任意输入-标签分布下,具有有界拒绝率的二分类问题的贝叶斯最优分类器具有何种形式?
- RQ2如何构建一种即插即用分类器,以确保即使在经验累积分布函数存在不连续性的情况下,拒绝率约束也能以高概率满足?
- RQ3在标准光滑性和边界假设下,此类分类器的过失风险上界可如何推导?
- RQ4所提算法在过失风险方面是否具有极小化最大误差的近似最优性?
- RQ5能否设计一种计算高效的基于凸损失的算法,使其在高维设置下仍保持理论上的过失风险保证?
主要发现
- 在不假设联合分布连续性的前提下,刻画了贝叶斯最优分类器,推广了Chow(1957)和Denis与Hebiri(2015)的先前结果。
- 所提即插即用分类器即使在经验累积分布函数存在不连续性的情况下,也能以高概率满足拒绝率约束,优于以往方法。
- 在Hölder光滑性和边界条件下,推导出过失风险的上界,证明了分类器对未知光滑性参数的自适应能力。
- 建立了下界,证明所提算法在过失风险方面具有极小化最大误差的近似最优性。
- 提出了一种基于凸损失代理的计算高效算法,并在可实现情况下提供了理论上的过失风险上界。
- 在UCI数据集上的实证评估表明,所提算法在不同拒绝率下均优于基线方法,在准确率-拒绝率权衡上表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。