Skip to main content
QUICK REVIEW

[论文解读] Attend in groups: a weakly-supervised deep learning framework for learning from web data

Bohan Zhuang, Lingqiao Liu|arXiv (Cornell University)|Nov 30, 2016
Advanced Neural Network Applications参考文献 36被引用 5
一句话总结

本文提出了一种弱监督深度学习框架,通过结合随机分组和注意力机制,提升从噪声网络图像中进行视觉识别的性能。通过构建图像组以提高组级别标签的准确性,并利用注意力机制抑制噪声特征,该方法在细粒度和通用图像分类任务上均取得了最先进性能,在高标签噪声条件下显著优于基线方法。

ABSTRACT

Large-scale datasets have driven the rapid development of deep neural networks for visual recognition. However, annotating a massive dataset is expensive and time-consuming. Web images and their labels are, in comparison, much easier to obtain, but direct training on such automatically harvested images can lead to unsatisfactory performance, because the noisy labels of Web images adversely affect the learned recognition models. To address this drawback we propose an end-to-end weakly-supervised deep learning framework which is robust to the label noise in Web images. The proposed framework relies on two unified strategies -- random grouping and attention -- to effectively reduce the negative impact of noisy web image annotations. Specifically, random grouping stacks multiple images into a single training instance and thus increases the labeling accuracy at the instance level. Attention, on the other hand, suppresses the noisy signals from both incorrectly labeled images and less discriminative image regions. By conducting intensive experiments on two challenging datasets, including a newly collected fine-grained dataset with Web images of different car models, the superior performance of the proposed methods over competitive baselines is clearly demonstrated.

研究动机与目标

  • 解决在大规模网络图像上训练深度网络时,因标签自动分配而产生的噪声问题。
  • 在无需人工标注干净标签的前提下,降低网络来源训练数据中标签噪声的负面影响。
  • 开发一种端到端的弱监督框架,对噪声标注具有鲁棒性,同时在下游任务中保持高性能。
  • 仅使用网络来源数据,在细粒度和通用图像分类基准上证明方法的有效性。
  • 通过引入简单而有效的训练策略,实现网络数据在训练鲁棒视觉模型中的实际应用。

提出的方法

  • 随机分组:将多个网络图像堆叠为单个训练样本,以提高组内至少一张图像被正确标注的概率,从而提升组级别标签的准确性。
  • 组级别表征:将组内所有图像的卷积特征图进行融合,形成该训练样本的统一特征表示。
  • 注意力机制:应用可学习的注意力模块,聚焦于判别性图像区域,抑制来自误标图像的无关或噪声特征。
  • 注意力正则化:引入正则化项,鼓励注意力模块聚焦于信息丰富的局部特征,避免对噪声信号的过拟合。
  • 端到端训练:将随机分组和注意力机制整合到单一、联合优化的深度学习流水线中,无需预训练。
  • 重排序策略:利用训练后模型的分类分数对训练数据进行重排序,优先选择高置信度、可能正确的样本,以提升数据质量。

实验结果

研究问题

  • RQ1通过随机分组网络图像,能否通过提高组级别标签正确性的概率来增强弱监督的可靠性?
  • RQ2注意力机制在在多大程度上能抑制误标图像中的噪声特征并提升模型泛化能力?
  • RQ3随机分组与注意力机制的结合,在高度噪声的网络数据上进行细粒度图像分类时,对性能有何影响?
  • RQ4所提出的框架能否在使用噪声网络数据的标准图像分类任务(如ImageNet)上实现泛化?
  • RQ5基于模型置信度对网络图像进行重排序,能否提升训练数据质量并改善下游性能?

主要发现

  • 在WebCars数据集上,标签噪声率达60%时,所提出的RGT+AT+R方法在组大小为4的情况下,实现了91.04%的平均平均精度(MAP),显著优于AP(74.42%)和AP+AT(90.56%)基线。
  • 在组大小为2时,该方法在ILSVRC2012验证集上从零开始训练,取得了71.24%的top-1准确率,比AP基线高出12.43个百分点。
  • 仅使用注意力机制,就在ImageNet网络数据设置中将准确率提升了约9%,证明其在过滤噪声特征方面的有效性。
  • 重排序策略成功优先选择了正确标注的图像,仅有少数误标样本被排在前列,表明其具备强大的数据质量选择能力。
  • 在ImageNet设置中,最优组大小被确定为2,此时性能达到峰值71.24%准确率,证实了组大小选择的重要性。
  • 注意力图的可视化显示,模型能正确地定位正确标注图像中的判别性区域,而对误标图像则未能聚焦,验证了注意力机制抑制噪声的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。