Skip to main content
QUICK REVIEW

[论文解读] Active Learning for Binary Classification with Abstention

Shubhanshu Shekhar, Mohammad Ghavamzadeh|arXiv (Cornell University)|Jun 1, 2019
Machine Learning and Algorithms参考文献 32被引用 6
一句话总结

本文提出了一种针对二分类带拒绝机制的主动学习算法,涵盖三种设置——固定成本和两种有界率变体,采用非参数框架。建立了极小化最大近似最优过剩风险界,并提出一种针对未知光滑性参数的自适应策略,同时针对高维问题设计了计算高效的变体。

ABSTRACT

We construct and analyze active learning algorithms for the problem of binary classification with abstention. We consider three abstention settings: \emph{fixed-cost} and two variants of \emph{bounded-rate} abstention, and for each of them propose an active learning algorithm. All the proposed algorithms can work in the most commonly used active learning models, i.e., \emph{membership-query}, \emph{pool-based}, and \emph{stream-based} sampling. We obtain upper-bounds on the excess risk of our algorithms in a general non-parametric framework and establish their minimax near-optimality by deriving matching lower-bounds. Since our algorithms rely on the knowledge of some smoothness parameters of the regression function, we then describe a new strategy to adapt to these unknown parameters in a data-driven manner. Since the worst case computational complexity of our proposed algorithms increases exponentially with the dimension of the input space, we conclude the paper with a computationally efficient variant of our algorithm whose computational complexity has a polynomial dependence over a smaller but rich class of learning problems.

研究动机与目标

  • 解决二分类带拒绝机制中主动学习方法的缺失问题,该设置下模型可推迟决策以降低错误成本。
  • 设计适用于三种拒绝机制设置的算法:固定成本、已知边缘概率的有界率,以及未知边缘概率的有界率。
  • 通过推导过剩风险的上界与匹配的下界,建立理论保证,证明其为极小化最大近似最优。
  • 开发一种数据驱动的自适应策略,以在无先验知识的情况下估计回归函数的未知光滑性参数。
  • 提出一种计算高效的变体,其时间复杂度为多项式,适用于高维问题,同时在丰富类别的学习任务中保持强性能。

提出的方法

  • 使用回归函数 $\eta(x) = P(Y=1|X=x)$ 建立问题框架,并定义将输入映射到包含 $\Delta$(拒绝)选项的标签分布的拒绝分类器。
  • 为三种设置设计主动学习算法:已知 $\lambda$ 的固定成本、已知 $P_X$ 的有界率,以及未知 $P_X$ 的有界率,采用池采样、流式学习和成员查询模型。
  • 在 $\eta(x)$ 的光滑性假设下使用非参数框架,包括霍尔德型正则性和 $P_X$ 的有界密度,以推导过剩风险界。
  • 提出一种新颖的自适应方案,通过数据驱动选择带宽和阈值来估计未知光滑性参数,提升鲁棒性。
  • 应用带噪声的二分查找策略,以精炼决策阈值附近的不确定性区域,减少所需标签数量。
  • 通过将搜索空间限制在低维流形或结构化输入空间,推导出一种计算高效的变体,使复杂度从 $D$ 的指数级降低为多项式级。

实验结果

研究问题

  • RQ1在非参数设置下,带拒绝机制的二分类主动学习策略能否实现极小化最大近似最优过剩风险?
  • RQ2在固定成本和有界率设置下,带拒绝机制的主动学习与被动学习在过剩风险方面的性能表现如何比较?
  • RQ3未知光滑性参数对算法性能有何影响?能否从数据中自适应估计?
  • RQ4环境维度 $D$ 如何影响带拒绝机制的主动学习的计算复杂度?是否可缓解?
  • RQ5能否设计一种计算高效的变体,在降低对 $D$ 的指数依赖的同时,仍保持强理论保证?

主要发现

  • 所提出的主动学习算法在过剩风险上界方面达到极小化最大近似最优,与固定成本和有界率设置下推导出的下界相匹配。
  • 在固定成本和有界率设置下,过剩风险的量级为 $O(n^{-\frac{\alpha_0 \beta}{2\alpha_0 \beta + D}})$,在光滑性和密度假设下成立,其中 $\alpha_0$ 和 $\beta$ 为光滑性参数。
  • 自适应策略成功在无先验知识下估计未知光滑性参数,且保持与非自适应版本相同的过剩风险速率。
  • 主算法的最坏情况计算复杂度随输入维度 $D$ 呈指数增长,但通过在受限问题类中使用多项式时间变体可有效缓解。
  • 检测性(DE)假设是必要的,以避免出现大的未分类区域;若无此假设,由于决策阈值附近边缘密度较差,算法收敛速率会下降。
  • 在额外假设 $P_X$ 具有下界有界密度时,风险界中的有效维度降低为 $\max\{0, D - \beta \alpha_0\}$,从而在低维流形中提升样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。