[论文解读] Towards Precise End-to-end Weakly Supervised Object Detection Network
本文提出一种端到端弱监督目标检测网络,通过在单一共享主干网络中联合优化多实例学习(MIL)检测与边界框回归,避免了两阶段训练中的局部极小值问题。引入一种分类引导的注意力模块,利用图像级别标签增强特征学习,在 PASCAL VOC 2007 和 2012 上取得当前最优性能,mAP 达到 47.0%,VOC 2007 上的 CorLoc 达到 60.6%。
It is challenging for weakly supervised object detection network to precisely predict the positions of the objects, since there are no instance-level category annotations. Most existing methods tend to solve this problem by using a two-phase learning procedure, i.e., multiple instance learning detector followed by a fully supervised learning detector with bounding-box regression. Based on our observation, this procedure may lead to local minima for some object categories. In this paper, we propose to jointly train the two phases in an end-to-end manner to tackle this problem. Specifically, we design a single network with both multiple instance learning and bounding-box regression branches that share the same backbone. Meanwhile, a guided attention module using classification loss is added to the backbone for effectively extracting the implicit location information in the features. Experimental results on public datasets show that our method achieves state-of-the-art performance.
研究动机与目标
- 解决两阶段弱监督目标检测的局限性,即 MIL 检测器对判别性部件过拟合,导致定位性能差。
- 克服第二阶段回归因 MIL 检测器生成的伪真实框不准确而导致的局部极小值问题。
- 通过端到端联合训练 MIL 检测器与边界框回归器,提升定位精度。
- 在主干网络中引入一种分类引导的注意力模块,增强特征表示以提升定位能力。
- 使用单一统一模型在 PASCAL VOC 2007 和 2012 上实现当前最优性能,超越多模型集成方法。
提出的方法
- 设计一个包含两个并行分支的深度神经网络:一个用于 MIL 检测,另一个用于类似 Fast R-CNN 的分类与回归,共享同一主干网络。
- 使用区域提议(例如来自 Selective Search)并为每张图像选择得分最高的提议作为回归分支的伪真实框。
- 引入一种引导注意力模块,利用图像级别分类损失监督特征学习,提升定位敏感性。
- 使用联合损失函数端到端联合训练两个分支,损失函数包含 MIL 分类损失、分类交叉熵损失与边界框回归损失。
- 在每次优化步骤后,对回归分支中的 RoI 进行特征重新提取,以保持空间一致性。
- 采用与 OICR 相同的代码库以确保公平比较,保证训练与评估协议的一致性。
实验结果
研究问题
- RQ1端到端联合优化 MIL 检测与边界框回归是否能提升弱监督目标检测中的定位精度?
- RQ2使用图像级别标签训练的引导注意力模块是否能增强用于目标定位的特征表示?
- RQ3联合训练策略是否能缓解 MIL 检测器对判别性部件(如猫的头部)的过拟合问题,从而解决两阶段方法的缺陷?
- RQ4在标准基准上,该方法与当前最优方法相比,在 mAP 和 CorLoc 指标上的表现如何?
- RQ5联合训练策略是否能减少对集成模型或多阶段流水线的依赖以实现高性能?
主要发现
- 所提方法在 PASCAL VOC 2007 上达到 47.0% mAP 与 60.6% CorLoc,优于基线方法 OICR+FRCN,并超越先前工作的集成模型。
- 与 OICR 基线相比,mAP 提升 6%,显著优于 C-WSL(尽管使用了额外的物体数量标签,仅提升 1.5%)。
- 在猫与狗类别上(易受过拟合影响),mAP 分别提升 38.6% 与 16.3%,表明对局部极小值有显著缓解效果。
- 联合训练策略降低了检测器对判别性部件的关注倾向,定性分析显示模型学习到更完整的物体位置。
- 单模型性能超越了当前最优方法的集成模型(如 OICR 的集成模型,mAP 为 48.6%),证明了统一架构的有效性。
- 引导注意力模块通过利用图像级别标签中的全局上下文信息,显著提升了特征学习能力,从而对检测精度有实质性贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。