Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Object Discovery and Co-Localization by Deep Descriptor Transforming

Xiu-Shen Wei, Chen-Lin Zhang|arXiv (Cornell University)|Jul 20, 2017
Advanced Image and Video Retrieval Techniques参考文献 4被引用 7
一句话总结

本文提出了一种新型无监督方法——深度描述符变换(Deep Descriptor Transforming, DDT),利用预训练卷积神经网络(CNN)的激活作为检测器,实现对未标记图像集中共现物体的共同定位。通过将深度描述符变换以评估图像间的相关性,DDT在图像共同定位任务中达到最先进性能,并实现了鲁棒、可扩展的网络图像采集,显著减少人工标注需求,从而提升识别与检测能力。

ABSTRACT

Reusable model design becomes desirable with the rapid expansion of computer vision and machine learning applications. In this paper, we focus on the reusability of pre-trained deep convolutional models. Specifically, different from treating pre-trained models as feature extractors, we reveal more treasures beneath convolutional layers, i.e., the convolutional activations could act as a detector for the common object in the image co-localization problem. We propose a simple yet effective method, termed Deep Descriptor Transforming (DDT), for evaluating the correlations of descriptors and then obtaining the category-consistent regions, which can accurately locate the common object in a set of unlabeled images, i.e., unsupervised object discovery. Empirical studies validate the effectiveness of the proposed DDT method. On benchmark image co-localization datasets, DDT consistently outperforms existing state-of-the-art methods by a large margin. Moreover, DDT also demonstrates good generalization ability for unseen categories and robustness for dealing with noisy data. Beyond those, DDT can be also employed for harvesting web images into valid external data sources for improving performance of both image recognition and object detection.

研究动机与目标

  • 解决在无类别标签或物体提议的情况下,图像集中无监督物体发现的挑战。
  • 探索预训练 CNN 除特征提取外的未充分利用潜力,特别是利用卷积激活作为物体检测器。
  • 开发一种对未见类别具有良好泛化能力,并能有效处理噪声、网络来源图像的方法。
  • 利用 DDT 处理的网络图像,实现自动数据增强,以提升图像识别与物体检测模型的性能。
  • 提供一种可扩展、无需标签的工具,用于采集和清洗网络图像,以构建高质量的外部训练数据。

提出的方法

  • 从预训练 CNN(如 VGG-16)的多个网络层中提取深度卷积描述符。
  • 利用主成分分析(PCA)将描述符变换到新空间,以评估图像间描述符的相关性。
  • 将第一主成分(P¹)用作指示矩阵,以在图像间定位共现物体。
  • 在图像间应用投票机制,生成一致且类别一致的物体定位掩码。
  • 通过集成多个 CNN 层次提升定位精度与鲁棒性。
  • 利用第二主成分(P²)实现潜在的基于部件的定位,揭示结构子区域(如车轮、头部等)。

实验结果

研究问题

  • RQ1预训练 CNN 的激活能否作为无监督图像共同定位中常见物体的有效检测器?
  • RQ2DDT 在无监督物体发现与弱监督定位任务中与当前最先进方法相比表现如何?
  • RQ3DDT 在未在 ImageNet 中出现过的未见类别上,其泛化能力达到何种程度?
  • RQ4DDT 是否能有效检测并过滤掉不包含目标物体的噪声图像?
  • RQ5DDT 是否可用于自动从网络图像中生成边界框与清洗数据,以提升下游识别与检测模型的性能?

主要发现

  • DDT 在图像共同定位任务中显著优于现有最先进方法,在无任何监督的情况下,于基准数据集上实现了更高的 mAP。
  • 在 PASCAL VOC 2007 测试集上,DDT+07++12 相较于标准的 07+12 训练集,mAP 提升了 2.8%。
  • 在 VOC 2012 上,DDT 增强方法实现的 mAP 比 07++12 高出 4%,与在 COCO(12 万张人工标注图像)上训练的模型性能相当。
  • DDT 展现出对未见类别的强泛化能力与对噪声图像的鲁棒性,能有效识别并过滤无关图像。
  • 该方法成功构建了一个新的物体检测数据集 WebVOC,包含 10,000 张网络图像与自动生成的边界框,其规模与类别集与 PASCAL VOC 相当。
  • 第二主成分(P²)揭示了有意义的部件级结构(如车轮、头部等),表明其在未来基于部件的共同定位中具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。