Skip to main content
QUICK REVIEW

[论文解读] Image Co-localization by Mimicking a Good Detector's Confidence Score Distribution

Yao Li, Linqiao Liu|arXiv (Cornell University)|Mar 15, 2016
Advanced Image and Video Retrieval Techniques被引用 5
一句话总结

该论文提出了一种新颖的无监督图像共同定位方法,通过模仿强监督检测器的置信度分数分布来训练通用目标检测器。通过强制实现稀疏、高熵的分数分布——仅少数候选框获得高置信度——该方法在无需任何边界框标注的情况下实现了共同定位,且在PASCAL VOC和ImageNet子集上的表现优于当前最先进水平的共同定位方法,并与弱监督定位方法相媲美。

ABSTRACT

Given a set of images containing objects from the same category, the task of image co-localization is to identify and localize each instance. This paper shows that this problem can be solved by a simple but intriguing idea, that is, a common object detector can be learnt by making its detection confidence scores distributed like those of a strongly supervised detector. More specifically, we observe that given a set of object proposals extracted from an image that contains the object of interest, an accurate strongly supervised object detector should give high scores to only a small minority of proposals, and low scores to most of them. Thus, we devise an entropy-based objective function to enforce the above property when learning the common object detector. Once the detector is learnt, we resort to a segmentation approach to refine the localization. We show that despite its simplicity, our approach outperforms state-of-the-art methods.

研究动机与目标

  • 解决在无任何边界框或负样本图像标注的情况下进行图像共同定位的挑战,仅依赖同一物体类别图像集合。
  • 通过学习置信度分数分布建模来克服现有共同定位方法依赖复杂推理或辅助监督的局限性,从而实现检测器的训练。
  • 通过显式建模强检测器的置信度分数分布来弥合检测与定位之间的差距,以指导无监督学习。
  • 通过结合颜色和空间上下文信息的CRF-based分割模块优化检测热力图,从而提高定位精度。

提出的方法

  • 使用一种新颖的基于熵的损失函数训练通用目标检测器,以鼓励稀疏的高置信度响应——仅少数候选框获得高分,从而模仿强监督检测器的行为。
  • 将目标函数表述为最小化每张图像的检测置信度分数的香农熵,以促进少数高分候选框的生成,同时抑制其余候选框。
  • 采用基于CRF的分割模型,结合检测热力图与颜色特征,以优化边界框预测并提高定位精度。
  • 利用预训练的CNN特征(如CaffeNet的fc6)作为目标候选框的输入,避免端到端训练,并支持迁移到未见类别。
  • 应用非极大值抑制和困难负样本挖掘,以在预测框上微调检测器,从而支持在标准检测基准上的评估。
  • 使用边缘框作为候选框生成方法,避免在训练中依赖真实标注。

实验结果

研究问题

  • RQ1能否通过模仿强监督检测器的置信度分数分布,在无监督设置下有效训练通用目标检测器?
  • RQ2在候选框上强制实现稀疏、高熵的置信度分数分布是否能提升共同定位任务中的定位性能?
  • RQ3集成基于CRF的优化步骤是否能将定位精度提升至超过原始检测热力图的水平?
  • RQ4在平均精度(mAP)和相关定位(CorLoc)指标方面,该方法与当前最先进水平的共同定位及弱监督目标定位方法相比表现如何?
  • RQ5该方法在预训练CNN特征提取器未见的物体类别上具有多大程度的鲁棒性?

主要发现

  • 在ImageNet子集上,该方法实现了48.3%的平均CorLoc,优于Cho等人[4]在相同基准上的37.7%,表明其对未见类别的强大泛化能力。
  • 在PASCAL VOC 2007上,该方法实现了40.0%的CorLoc,与近期弱监督方法(40.2%)性能相当,尽管未使用任何负样本图像。
  • 在PASCAL VOC 2007数据集的20个类别中,该方法在17个类别上优于当前最先进水平的共同定位方法,尤其在'raccoon'和'stoat'等具有挑战性的类别上表现显著。
  • 可视化结果表明,检测热力图能成功在尺度、视角和外观变化下定位物体,表明其在无监督条件下具备稳健的特征学习能力。
  • 'rake'和'wheelchair'的失败案例可解释——由于频繁的人机交互,模型误将人类视为共同物体,凸显了模型对常见场景上下文的敏感性。
  • 在预测框和负样本上进行微调后,该方法在PASCAL VOC 2007测试集上实现了16.7%的mAP,显示出向弱监督检测任务扩展的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。