Skip to main content
QUICK REVIEW

[论文解读] ConceptLearner: Discovering Visual Concepts from Weakly Labeled Image Collections

Bolei Zhou, Vignesh Jagadeesh|arXiv (Cornell University)|Nov 19, 2014
Advanced Image and Video Retrieval Techniques参考文献 31被引用 6
一句话总结

ConceptLearner 提出了一种可扩展的、最大间隔的困难样本学习方法,从弱标签图像集合中发现超过 10,000 个视觉概念检测器——仅使用标签或描述,无需人工标注的边界框。该方法在图像级识别和区域级检测任务中均表现出色,在 SUN 和 Pascal VOC 2007 数据集上,于领域选择性监督下,性能优于弱监督和网页监督基线方法。

ABSTRACT

Discovering visual knowledge from weakly labeled data is crucial to scale up computer vision recognition system, since it is expensive to obtain fully labeled data for a large number of concept categories. In this paper, we propose ConceptLearner, which is a scalable approach to discover visual concepts from weakly labeled image collections. Thousands of visual concept detectors are learned automatically, without human in the loop for additional annotation. We show that these learned detectors could be applied to recognize concepts at image-level and to detect concepts at image region-level accurately. Under domain-specific supervision, we further evaluate the learned concepts for scene recognition on SUN database and for object detection on Pascal VOC 2007. ConceptLearner shows promising performance compared to fully supervised and weakly supervised methods.

研究动机与目标

  • 解决在缺乏昂贵全标注数据集的情况下扩展视觉识别系统所面临的挑战。
  • 从标签存在噪声、缺失或不精确的弱标签图像集合中发现视觉概念。
  • 开发一种完全自动化的、无需人工参与的视觉概念检测器大规模学习方法。
  • 通过领域选择性监督评估所学检测器在新数据集上的泛化能力。
  • 证明所发现概念在图像级识别和区域级检测任务中的实用性。

提出的方法

  • 利用 NUS-WIDE 和 SBU 等数据集中的图像标签或简短描述作为监督信号。
  • 应用可扩展的最大间隔学习框架,并结合困难样本挖掘,从弱标签数据中训练视觉概念检测器。
  • 采用两阶段流程:首先在源数据集上学习概念检测器;其次通过领域选择性监督将其应用于新数据集。
  • 采用源自 R-CNN 的区域提议和深度特征提取流程,用于目标检测评估。
  • 基于验证集表现选择表现最佳的概念检测器,将其迁移至 Pascal VOC 2007。
  • 整合语法结构和共现约束,以优化预测结果并减少检测到的概念之间的冗余。

实验结果

研究问题

  • RQ1能否在无需人工标注边界框的情况下,从弱标签图像集合中大规模发现视觉概念?
  • RQ2从弱标签数据中学到的概念检测器在新数据集(如 SUN 和 Pascal VOC 2007)上的泛化能力如何?
  • RQ3领域选择性监督能否提升弱学习检测器在下游识别与检测任务中的性能?
  • RQ4ConceptLearner 在场景和目标识别任务中与全监督和弱监督基线方法相比表现如何?
  • RQ5所发现的概念检测器能否在图像级识别和区域级检测任务中均有效应用?

主要发现

  • ConceptLearner 从 NUS-WIDE 和 SBU 数据集的弱标签数据中,无需人工标注,成功学习了超过 10,000 个视觉概念检测器。
  • 在 SUN 数据库上,该方法在场景识别任务中实现了 35.6% 的平均 mAP,优于弱监督和网页监督基线方法。
  • 在 Pascal VOC 2007 上,该方法在 20 个目标类别上的平均精度(AP)达到 44.7%,超越了网页监督和视频监督方法。
  • 在 Pascal VOC 2007 的 20 个类别中,该方法在 14 个类别上优于最先进的弱监督方法 ICML’14 [31]。
  • 通过领域选择性监督,该方法展现出强大的泛化能力,实现了在新数据集上的有效迁移,且仅需极少微调。
  • 该框架同时支持图像级识别和区域级检测,结果表明在两种设置下均具有高精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。