[论文解读] WebVision Challenge: Visual Learning and Understanding With Web Data
WebVision挑战赛引入了一个大规模的网络图像数据集,包含超过240万张从Google Images和Flickr爬取的图像,使用ILSVRC 2012概念进行筛选,并附带人工标注的验证集和测试集。该数据集通过两个任务推动从噪声较大的网络来源数据中学习视觉表征的研究:在WebVision测试集上的图像分类任务,以及在PASCAL VOC 2012上的迁移学习任务,从而推进自监督和弱监督学习方法的发展。
We present the 2017 WebVision Challenge, a public image recognition challenge designed for deep learning based on web images without instance-level human annotation. Following the spirit of previous vision challenges, such as ILSVRC, Places2 and PASCAL VOC, which have played critical roles in the development of computer vision by contributing to the community with large scale annotated data for model designing and standardized benchmarking, we contribute with this challenge a large scale web images dataset, and a public competition with a workshop co-located with CVPR 2017. The WebVision dataset contains more than $2.4$ million web images crawled from the Internet by using queries generated from the $1,000$ semantic concepts of the benchmark ILSVRC 2012 dataset. Meta information is also included. A validation set and test set containing human annotated images are also provided to facilitate algorithmic development. The 2017 WebVision challenge consists of two tracks, the image classification task on WebVision test set, and the transfer learning task on PASCAL VOC 2012 dataset. In this paper, we describe the details of data collection and annotation, highlight the characteristics of the dataset, and introduce the evaluation metrics.
研究动机与目标
- 通过提供一个大规模、公开可访问的数据集,且仅需最少的人工标注,推动从网络数据中学习视觉表征。
- 解决从带有弱监督信号(如标题、标签)的噪声网络图像中学习鲁棒视觉模型的挑战。
- 建立一个标准化基准,用于评估在网页数据上训练的模型性能,其可比性相当于ILSVRC和Places2。
- 通过在CVPR 2017举办公开竞赛和研讨会,促进自监督、半监督和弱监督学习的研究。
提出的方法
- 使用ILSVRC 2012数据集中1,000个语义概念,从Google图像搜索和Flickr爬取超过240万张图像,以确保语义一致性。
- 收集丰富的元数据(标题、描述、标签)与图像一同存储,为表征学习提供弱监督信号。
- 构建了各包含50,000张人工标注图像的验证集和测试集,以支持算法评估和模型开发。
- 举办公开竞赛,包含两个赛道:(1) 仅使用训练集在WebVision测试集上进行图像分类;(2) 使用在WebVision上训练的模型在PASCAL VOC 2012上进行迁移学习。
- 采用标准评估指标:分类任务使用top-1准确率,迁移学习任务使用平均精度均值(mAP)。
- 提供公开平台和在CVPR 2017举办的研讨会,以促进基于网络的视觉学习领域的合作与基准测试。
实验结果
研究问题
- RQ1在噪声较大的网络来源图像上训练的深度模型,在性能上能在多大程度上达到在人工标注数据集(如ImageNet)上训练的模型的水平?
- RQ2弱监督信号(如标题、标签)在提升从网络数据中学习视觉表征方面的有效性如何?
- RQ3网络图像(如来自Google和Flickr)与标准基准数据集(如ILSVRC 2012)之间存在的领域差异有何影响?
- RQ4在WebVision上预训练的模型在下游任务(如PASCAL VOC 2012上的目标检测和分类)上的泛化能力如何?
- RQ5从网络数据中学习的主要挑战是什么,特别是标签噪声和数据分布偏移方面?
主要发现
- WebVision数据集包含超过240万张从Google Images和Flickr爬取的网络图像,使用ILSVRC 2012概念构建,支持大规模表征学习。
- 在初始20万张图像样本中,约20%被标记为噪声(0票),而符合标准的图像(2或3票)仅占总数的66%,表明存在显著的标签噪声。
- 最清晰的类别“Tractor”(867)在200张图像中有199张为有效标注,而最嘈杂的类别“lighter”(627)仅有24张有效标注,显示不同类别间标签质量存在极大差异。
- 数据集表现出领域差异:Google图像通常具有干净背景和良好构图的对象,而Flickr图像则更加多样化,常包含小型或杂乱的对象。
- 验证集和测试集各包含50,000张人工标注图像,可实现对模型性能和泛化能力的可靠评估。
- 该挑战赛成功实现了对自监督和弱监督学习方法的基准测试,相关结果已在CVPR 2017研讨会公布,并通过公开数据集发布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。