Skip to main content
QUICK REVIEW

[论文解读] Detector Discovery in the Wild: Joint Multiple Instance and Representation Learning

Judy Hoffman, Deepak Pathak|arXiv (Cornell University)|Dec 2, 2014
Domain Adaptation and Few-Shot Learning参考文献 33被引用 7
一句话总结

本文提出了一种联合学习框架,通过利用辅助类别的强标注信息,同时优化目标检测器的表示并检测弱标签图像中的对象。通过结合多实例学习与跨域表示迁移,该方法在 ImageNet-200 检测任务上相较于以往的弱监督方法实现了 200% 的 mAP 提升,相较于领域自适应基线方法提升了 12%。

ABSTRACT

We develop methods for detector learning which exploit joint training over both weak and strong labels and which transfer learned perceptual representations from strongly-labeled auxiliary tasks. Previous methods for weak-label learning often learn detector models independently using latent variable optimization, but fail to share deep representation knowledge across classes and usually require strong initialization. Other previous methods transfer deep representations from domains with strong labels to those with only weak labels, but do not optimize over individual latent boxes, and thus may miss specific salient structures for a particular category. We propose a model that subsumes these previous approaches, and simultaneously trains a representation and detectors for categories with either weak or strong labels present. We provide a novel formulation of a joint multiple instance learning method that includes examples from classification-style data when available, and also performs domain transfer learning to improve the underlying detector representation. Our model outperforms known methods on ImageNet-200 detection with weak labels.

研究动机与目标

  • 解决在仅获得目标类别弱标签(例如,图像级标签)时训练高精度目标检测器的挑战。
  • 克服先前方法的局限性,这些方法要么忽略辅助的强标签数据,要么无法联合优化表示与检测器。
  • 通过将从强标签辅助类别中学习到的感知表示迁移至弱标签目标类别,提升检测器性能。
  • 在仅需少量边界框标注的情况下,实现对野外场景中罕见或代表性不足类别的有效检测。

提出的方法

  • 提出一种新颖的联合多实例学习(MIL)框架,将弱标签图像和强标签辅助数据均视为区域袋(bags of regions),实现对潜在目标提议的联合优化。
  • 将在强标签辅助类别(如 ImageNet-100)上训练的检测模型所学习到的深度特征表示迁移至弱标签目标类别(如 ImageNet-200),以改善初始化与泛化能力。
  • 采用两阶段训练流程:首先,通过 MIL 在弱标签图像中发现正样本对象区域;其次,利用发现的区域与强标签联合微调特征表示与检测器权重。
  • 采用一种卷积神经网络架构,其中所有全连接层在微调过程中均被更新,以同时优化特征与检测头,提升定位与分类精度。
  • 将分类式数据(弱标签)与检测式数据(强标签)整合进统一的优化目标,实现在不同类别间共享表示知识。
  • 应用领域自适应原则,对齐源域(辅助)与目标域(目标)之间的特征分布,提升对未见类别的泛化能力。

实验结果

研究问题

  • RQ1与单独优化检测器或表示相比,联合学习表示与检测器是否能提升弱监督目标检测的性能?
  • RQ2来自辅助类别的强标签在仅具有弱标签的目标类别上,能在多大程度上提升检测性能?
  • RQ3在正样本区域发现后,联合优化特征表示与检测权重是否能带来优于独立微调的定位与分类性能?
  • RQ4在弱标签检测基准上,该方法相较于当前最先进水平的基于 MIL 与基于领域自适应的方法,在 mAP 指标上的表现如何?

主要发现

  • 所提方法在使用弱标签的 ImageNet-200 检测基准上,相较于之前最先进水平的基于 MIL 的方法(LCL),mAP 提升了 200%。
  • 在相同基准上,该方法相较于之前最佳的领域自适应方法(LSDA)mAP 提升 12%,证明了联合 MIL 与表示学习的有效性。
  • 在正样本区域发现后,联合微调特征表示与检测头可获得最高性能,在 ILSVRC13 的 val2 数据集上 mAP 达到 22.74%。
  • 模型显著减少了定位错误以及与共现或相似类别(例如,在体育场景中将球误检为球员)的混淆,如定性比较所示。
  • 该方法能有效发现复杂场景中的小物体,如头盔或球,而以往方法因与更大、更显著的前景物体混淆而失败。
  • 该模型在训练集中未见的新类别上泛化能力良好,实现了仅需极少或无需边界框标注即可完成检测器发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。