Skip to main content
QUICK REVIEW

[论文解读] One-bit Supervision for Image Classification

Hengtong Hu, Lingxi Xie|arXiv (Cornell University)|Sep 14, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用 4
一句话总结

本文提出了一种名为一比特监督的新颖自监督学习设定,其中模型查询预测标签并仅接收每个样本的“是/否”响应,从而大幅降低标注成本。通过采用多阶段训练框架并结合负类抑制,该方法随时间推移逐步提高预测准确率,并有效利用错误预测,相较于标准自监督学习方法,在相同标注预算下于CIFAR100、Mini-ImageNet和ImageNet上实现了更高的准确率。

ABSTRACT

This paper presents one-bit supervision, a novel setting of learning from incomplete annotations, in the scenario of image classification. Instead of training a model upon the accurate label of each sample, our setting requires the model to query with a predicted label of each sample and learn from the answer whether the guess is correct. This provides one bit (yes or no) of information, and more importantly, annotating each sample becomes much easier than finding the accurate label from many candidate classes. There are two keys to training a model upon one-bit supervision: improving the guess accuracy and making use of incorrect guesses. For these purposes, we propose a multi-stage training paradigm which incorporates negative label suppression into an off-the-shelf semi-supervised learning algorithm. In three popular image classification benchmarks, our approach claims higher efficiency in utilizing the limited amount of annotations.

研究动机与目标

  • 通过将全标签标注替换为简单的“是/否”反馈,降低大规模类别图像分类中的高标注成本。
  • 解决在仅每样本提供一位信息(正确/错误)的稀疏弱监督下高效学习的挑战。
  • 通过在多个训练阶段逐步提升模型生成预测的准确率,从而提高模型性能。
  • 通过在损失函数中抑制预测类别,有效利用错误预测,将负面反馈转化为有用的训练信号。
  • 证明在一模一样监督比特数的约束下,一比特监督可实现比传统自监督学习更高的学习效率。

提出的方法

  • 该方法采用多阶段训练范式,模型在无标签数据上迭代查询其预测结果。
  • 在每个阶段,模型对无标签图像的一个随机子集进行预测,并接收一位反馈(正确或错误)。
  • 正确预测被加入有监督数据集,而错误预测则用于在损失函数中抑制预测类别。
  • 通过最小化模型在错误预测类别上的置信度,实现负类抑制,从而将错误预测转化为弱负信号。
  • 训练从少量准确标签开始,并使用预训练模型(如Mean-Teacher)作为自监督学习的基线。
  • 在每个阶段,模型使用扩展后的有标签数据集和抑制后的负信号重新训练,逐步提升预测准确率。

实验结果

研究问题

  • RQ1当每个预测仅提供“是/否”响应时,一比特监督能否实现比标准自监督学习更高的学习效率?
  • RQ2在一比特监督中,如何有效利用错误预测作为训练信号,而非将其丢弃?
  • RQ3是否多阶段训练框架通过逐步提升预测准确率,能带来更好的模型性能?
  • RQ4负类抑制是否能显著提升在高类别图像分类任务中从弱监督中学习的能力?
  • RQ5当一比特监督与全标签自监督学习在相同监督比特数下比较时,其表现如何?

主要发现

  • 一比特监督将每张图像的平均标注时间降低至2.72秒(准确率达92.3%),相比全标签标注的约1分钟,验证了其在大规模类别场景下的高效性。
  • 所提出的多阶段框架结合负类抑制,在CIFAR100、Mini-ImageNet和ImageNet上,使用相同监督比特数时,准确率高于标准自监督学习方法。
  • 在CIFAR100和Mini-ImageNet上,使用20%准确标签加一比特反馈的方案,在学习效率上优于使用100%准确标签的自监督学习方法。
  • 诊断性实验确认,性能提升源于对不完整监督更有效的利用,尤其是通过提升预测准确率和负类利用效率。
  • 该方法在具有不同类别数的数据集上表现出鲁棒性,显示出在数据稀缺场景中实际部署的强大潜力。
  • 该框架可推广至其他视觉任务,表明其在目标检测和语义分割等任务中,采用类似弱监督范式具有适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。