Skip to main content
QUICK REVIEW

[论文解读] Online Multiclass Classification Based on Prediction Margin for Partial Feedback

Takuo Kaneko, Issei Sato|arXiv (Cornell University)|Feb 4, 2019
Advanced Bandit Algorithms Research参考文献 17被引用 13
一句话总结

本文提出CSPA,一种用于部分反馈场景的确定性在线多分类算法,通过利用预测置信度间隔和互补标签来提升性能。通过结合正确预测时的支撑类被动攻击更新与错误预测时受互补标签启发的更新策略,CSPA在现有非置信度间隔方法和随机方法中表现出更优的实验准确率与稳定性,并具备理论保证的累积平方损失界。

ABSTRACT

We consider the problem of online multiclass classification with partial feedback, where an algorithm predicts a class for a new instance in each round and only receives its correctness. Although several methods have been developed for this problem, recent challenging real-world applications require further performance improvement. In this paper, we propose a novel online learning algorithm inspired by recent work on learning from complementary labels, where a complementary label indicates a class to which an instance does not belong. This allows us to handle partial feedback deterministically in a margin-based way, where the prediction margin has been recognized as a key to superior empirical performance. We provide a theoretical guarantee based on a cumulative loss bound and experimentally demonstrate that our method outperforms existing methods which are non-margin-based and stochastic.

研究动机与目标

  • 解决在仅反馈预测正确与否而未提供真实标签的在线多分类部分反馈问题。
  • 改进现有方法中非置信度间隔或依赖随机探索策略的局限,这些方法在实际应用中性能受限。
  • 开发一种确定性、基于置信度间隔的算法,利用互补标签指导错误预测时的模型更新。
  • 通过累积平方损失界为所提方法提供理论收敛保证。

提出的方法

  • 算法采用参数线性模型,每个类别对应一个权重向量 w_i ∈ ℝ^d,用于计算每个类别的得分 w_i^T x。
  • 在每轮迭代中,预测标签 ŷ_t 选择为得分最高的类别:ŷ_t = argmax_i w_i,t^T x_t。
  • 对于正确预测,算法应用支撑类被动攻击(SPA)更新规则,基于预测置信度间隔进行更新。
  • 对于错误预测,算法引入一种新颖的更新规则,受互补标签学习启发,使模型降低对错误预测类别的置信度。
  • 更新规则通过最小化一个代理损失函数推导得出,该函数惩罚错误预测,同时保持置信度间隔结构。
  • 通过固定700个实例的支撑集,将方法扩展至非线性场景,实现核化特征映射。

实验结果

研究问题

  • RQ1能否设计一种确定性、基于置信度间隔的算法,在部分反馈的在线多分类任务中超越现有随机方法与非置信度间隔方法?
  • RQ2如何在部分反馈的多分类学习框架中,有效整合互补标签机制?
  • RQ3此类方法可建立何种理论保证,特别是关于累积损失与误分类次数的界?
  • RQ4所提方法在不同数据集上的性能表现如何?其在线性与非线性设置下的可扩展性如何?

主要发现

  • 在所有测试数据集的线性和非线性设置中,CSPA在正确预测标签比例方面显著优于Banditron、Confidit和BPA。
  • 在线性情况下,六组数据集中的五组中,CSPA实现了最高的平均正确预测标签比例,且如图3阴影区域所示,其性能波动更小,表现更稳定。
  • 在使用高斯核的非线性场景中,CSPA在几乎所有数据集上均保持了卓越性能,如图4所示,表明其对函数复杂度具有强鲁棒性。
  • 理论分析建立了累积平方损失界,为算法在对抗性条件下的收敛性提供了理论保障。
  • CSPA中的超参数β对噪声数据具有鲁棒性;将β设置在理论保证范围内可确保稳定性,尽管在非对抗性设置下,较高β值可能带来更优的实验结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。