Skip to main content
QUICK REVIEW

[论文解读] Towards Automatic Construction of Diverse, High-quality Image Dataset

Yazhou Yao, Jian Zhang|arXiv (Cornell University)|Aug 22, 2017
Advanced Image and Video Retrieval Techniques参考文献 43被引用 3
一句话总结

本文提出了一种基于网络的自动框架,通过使用多个文本查询和多视图、多实例学习,构建多样化、高质量的图像数据集,以过滤噪声图像和查询。与现有的弱监督和网络监督方法相比,该方法在图像分类、跨数据集泛化和目标检测任务中表现更优,并公开发布了100类的基准数据集(WSID-100)。

ABSTRACT

The availability of labeled image datasets has been shown critical for high-level image understanding, which continuously drives the progress of feature designing and models developing. However, constructing labeled image datasets is laborious and monotonous. To eliminate manual annotation, in this work, we propose a novel image dataset construction framework by employing multiple textual queries. We aim at collecting diverse and accurate images for given queries from the Web. Specifically, we formulate noisy textual queries removing and noisy images filtering as a multi-view and multi-instance learning problem separately. Our proposed approach not only improves the accuracy but also enhances the diversity of the selected images. To verify the effectiveness of our proposed approach, we construct an image dataset with 100 categories. The experiments show significant performance gains by using the generated data of our approach on several tasks, such as image classification, cross-dataset generalization, and object detection. The proposed method also consistently outperforms existing weakly supervised and web-supervised approaches.

研究动机与目标

  • 解决人工构建数据集的局限性,即劳动密集且难以扩展。
  • 克服使用图像搜索引擎进行网络图像数据集构建时的可扩展性、准确性和多样性挑战。
  • 通过利用多个文本查询减少对人工标注的依赖,从而提升图像收集的多样性和质量。
  • 开发一个统一框架,联合过滤类间和类内噪声图像,同时保持数据集的多样性。
  • 构建一个基准数据集(WSID-100),用于评估计算机视觉领域中的弱监督和网络监督学习算法。

提出的方法

  • 为每个类别使用多个文本查询,以增强图像收集的可扩展性和多样性,降低数据集偏差。
  • 采用多视图、多实例学习(MIL)方法,通过线性规划方法联合过滤类间和类内噪声图像。
  • 通过识别语义丰富、相关的查询,并移除视觉上不显著或无关的查询,对噪声文本查询进行分类和过滤。
  • 将图像噪声分为三类——类间噪声、类内噪声和查询特定噪声,并为每类应用定制化的过滤策略。
  • 利用视觉聚类和袋(聚类)内实例级分类,提升图像重排序和噪声抑制效果。
  • 使用三重交叉验证调优关键参数(如 $S_i$,$ abla$),以在噪声过滤中实现最优的召回率和精确率。

实验结果

研究问题

  • RQ1与单查询方法相比,多个文本查询是否能显著提升自动收集图像数据集的多样性和可扩展性?
  • RQ2联合使用多视图和多实例学习方法,在保持数据集多样性的同时,对类间和类内噪声图像的过滤效果如何?
  • RQ3所提出的框架在图像分类和目标检测等下游任务中,相较于现有弱监督和网络监督方法,性能提升程度如何?
  • RQ4该框架对超参数变化的鲁棒性如何,特别是在噪声过滤和查询选择阶段?
  • RQ5所生成的数据集(WSID-100)能否作为评估计算机视觉领域弱监督学习算法的可靠基准?

主要发现

  • 与人工标注和网络监督基线相比,所提出框架显著提升了图像分类准确率和跨数据集泛化性能。
  • 使用该方法构建的WSID-100数据集,在VOC 2007数据集上进行预训练时,目标检测任务达到了最先进性能。
  • 当 $ abla = 10^0$ 时,该方法在类间噪声过滤中实现了98.2%的平均准确率,表现出高度的鲁棒性和有效性。
  • 通过选择 $S_i = 0.6$,框架在保持高召回率(0.6)的同时实现了可接受的精确率,实现了图像选择中覆盖率与质量的平衡。
  • 该数据集对参数变化具有鲁棒性,在 $ abla$ 的广泛取值范围内,过滤准确率均保持在96%以上。
  • 该框架通过联合优化多样性和准确性,优于迭代方法,避免了顺序过滤方法中常见的多样性损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。