[论文解读] Self-taught Object Localization with Deep Networks
本文提出了一种自学生对象定位方法,该方法利用预训练的深度卷积神经网络在无需任何人工标注边界框的情况下定位图像中的对象。通过系统性地遮蔽图像区域并测量识别分数的下降,该方法利用层次聚类识别对象位置,在 ILSVRC-2012 数据集上相比最先进方法实现了 23.4% 的相对召回率提升,并生成可用于训练检测器的高质量提议区域。
This paper introduces self-taught object localization, a novel approach that leverages deep convolutional networks trained for whole-image recognition to localize objects in images without additional human supervision, i.e., without using any ground-truth bounding boxes for training. The key idea is to analyze the change in the recognition scores when artificially masking out different regions of the image. The masking out of a region that includes the object typically causes a significant drop in recognition score. This idea is embedded into an agglomerative clustering technique that generates self-taught localization hypotheses. Our object localization scheme outperforms existing proposal methods in both precision and recall for small number of subwindow proposals (e.g., on ILSVRC-2012 it produces a relative gain of 23.4% over the state-of-the-art for top-1 hypothesis). Furthermore, our experiments show that the annotations automatically-generated by our method can be used to train object detectors yielding recognition results remarkably close to those obtained by training on manually-annotated bounding boxes.
研究动机与目标
- 开发一种无需人工标注边界框的物体定位方法,仅依赖图像级别类别标签。
- 通过分析区域遮蔽下的识别分数变化,利用预训练的深度网络实现弱监督定位。
- 生成可用于训练高精度物体检测器而无需人工标注的高质量物体提议。
- 评估该方法在不同数据集(如 PASCAL VOC 2007)上的泛化能力。
提出的方法
- 该方法分析当使用预训练的 ImageNet 分类器对图像的不同区域进行人为遮蔽时,识别分数的变化。
- 当遮蔽后分类分数显著下降的区域,被认为可能包含目标物体。
- 采用凝聚聚类技术,根据识别分数的相对下降程度对图像区域进行分组,形成分层的子窗口提议。
- 该方法结合多尺度、自底向上的区域提议策略与来自深度网络的自顶向下的判别性反馈。
- 最终的定位假设基于所有遮蔽区域中分类分数的最大下降值进行选择。
- 该方法对标签模糊具有鲁棒性,即使仅提供最高预测类别也能正常运行。
实验结果
研究问题
- RQ1能否仅使用图像级别标签而无需边界框标注实现物体定位?
- RQ2识别分数对区域遮蔽的敏感性在识别物体位置方面有多有效?
- RQ3该方法自动生成的提议是否足以训练出性能接近人工标注边界框训练的检测器?
- RQ4该方法在不同数据集和物体类别上的泛化能力如何?
主要发现
- 所提方法在 ILSVRC-2012 数据集上相比最先进方法实现了 23.4% 的相对召回率提升。
- 对于少量提议(例如 1–100 个),该方法在精确率和召回率方面均优于现有 objectness 方法。
- 该方法自动生成的子窗口可用于训练物体检测器,其识别性能非常接近使用人工标注边界框训练的检测器。
- 该方法在 PASCAL VOC 2007 数据集上表现出良好的泛化能力,展示了在不同物体类别和数据集间的可迁移性。
- 在存在多个相似物体(如多只狗)的情况下,该方法能成功将所有实例聚为一组,因为同时遮蔽它们会导致分类分数最大下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。