Skip to main content
QUICK REVIEW

[论文解读] Activity Driven Weakly Supervised Object Detection

Zhenheng Yang, Dhruv Mahajan|arXiv (Cornell University)|Apr 2, 2019
Human Pose and Action Recognition参考文献 52被引用 4
一句话总结

本文提出了一种基于活动的弱监督目标检测框架,利用动作标签在无需边界框标注的情况下提升目标定位性能。通过基于人-物交互建模空间先验、学习跨动作的一致性目标外观,并联合训练动作与目标分类器,该方法在Charades视频数据集上相比SOTA方法实现了6%的mAP提升。

ABSTRACT

Weakly supervised object detection aims at reducing the amount of supervision required to train detection models. Such models are traditionally learned from images/videos labelled only with the object class and not the object bounding box. In our work, we try to leverage not only the object class labels but also the action labels associated with the data. We show that the action depicted in the image/video can provide strong cues about the location of the associated object. We learn a spatial prior for the object dependent on the action (e.g. "ball" is closer to "leg of the person" in "kicking ball"), and incorporate this prior to simultaneously train a joint object detection and action classification model. We conducted experiments on both video datasets and image datasets to evaluate the performance of our weakly supervised object detection model. Our approach outperformed the current state-of-the-art (SOTA) method by more than 6% in mAP on the Charades video dataset.

研究动机与目标

  • 通过利用动作类别标签作为弱监督,减少对昂贵边界框标注的依赖。
  • 通过利用从动作中提取的人-物交互的空间与外观先验,提升弱监督检测中的定位精度。
  • 通过联合训练目标检测与动作分类模型,增强特征学习并实现相互监督。
  • 在视频和图像数据集(包括第一人称视频)上评估基于活动的弱监督的有效性。
  • 证明基于动作标签的弱监督可显著减少目标检测中对强监督的需求。

提出的方法

  • 该方法基于参与动作的人体部位(如手)建立目标的空间先验,将目标位置建模为依赖于动作上下文。
  • 提出一种联合训练框架,通过共享特征和多任务学习,同时优化动作分类与目标检测。
  • 训练一个通用的目标外观模型,覆盖同一对象在不同动作中的表现,确保特征学习的一致性。
  • 模型使用RPN生成目标提议,并应用分类头预测目标存在性,其监督信号来源于动作标签。
  • 引入一种弱监督损失,鼓励根据动作上下文和空间先验正确选择目标提议。
  • 通过使用基于中心的空间先验,将该方法扩展至第一人称视频,因为人体关键点检测在此类视频中不可行。

实验结果

研究问题

  • RQ1动作标签能否提供有意义的空间与外观先验,以提升弱监督目标检测性能?
  • RQ2与独立训练相比,动作与目标分类的联合学习在多大程度上提升了检测性能?
  • RQ3基于活动的监督在多大程度上可减少目标检测中对边界框标注的需求?
  • RQ4该方法在不同数据模态(包括视频与图像)上的泛化能力如何?
  • RQ5在结合基于动作的弱监督时,添加有限的真实边界框会对性能产生何种影响?

主要发现

  • 所提方法在Charades视频数据集上相比之前SOTA方法实现了6%的mAP提升,证明了其在弱监督检测中的强大性能。
  • 在HICO-DET图像数据集上,该方法优于现有弱监督方法,表明其在视频数据之外也具有良好的泛化能力。
  • 在第一人称EPIC-KITCHENS数据集上,该方法优于R*CNN和PCL,得益于第一人称视频中隐含的空间先验。
  • 仅使用70%训练样本包含边界框标注时,该方法在Charades上的性能与100%标注的全监督模型相当。
  • 即使在100%边界框标注的情况下,该方法仍比全监督基线模型高出2个mAP点,得益于与动作和目标分类的联合训练优势。
  • 消融实验表明,空间先验、联合训练和外观建模三个组件均对最终性能有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。