[论文解读] Learning to discover and localize visual objects with open vocabulary
本文提出了一种弱监督目标检测框架,通过图像-标题配对学习发现并定位视觉对象,而无需预定义的物体类别或边界框标注。通过在共享嵌入空间中建模图像-词注意力并引入基于边缘梯度的新型物体度量准则,该方法仅使用噪声标题就在 COCO 上实现了 6.91% 的 mAP@0.50 IoU,展示了从大规模网络数据中实现有效开放词汇检测的能力。
To alleviate the cost of obtaining accurate bounding boxes for training today's state-of-the-art object detection models, recent weakly supervised detection work has proposed techniques to learn from image-level labels. However, requiring discrete image-level labels is both restrictive and suboptimal. Real-world "supervision" usually consists of more unstructured text, such as captions. In this work we learn association maps between images and captions. We then use a novel objectness criterion to rank the resulting candidate boxes, such that high-ranking boxes have strong gradients along all edges. Thus, we can detect objects beyond a fixed object category vocabulary, if those objects are frequent and distinctive enough. We show that our objectness criterion improves the proposed bounding boxes in relation to prior weakly supervised detection methods. Further, we show encouraging results on object detection from image-level captions only.
研究动机与目标
- 为解决固定词汇表目标检测器的局限性,实现对预定义类别之外物体的检测。
- 通过利用网络上丰富的弱监督图像-标题配对,减少对昂贵边界框标注的依赖。
- 从非结构化、噪声标题中学习有意义的视觉-物体关联,而无需图像级标签或真实边界框。
- 开发一种鲁棒的物体度量指标,基于边缘处梯度的一致性识别高质量候选边界框。
- 仅使用图像-标题对训练一个可泛化的检测器,实现对新出现、常见且具有特征的物体的发现。
提出的方法
- 通过在共享嵌入空间中计算图像区域与标题中词语之间的成对相似度,学习空间激活图。
- 使用三元组损失进行模型训练,以最大化匹配图像-标题对之间的相似度,同时最小化与负样本对的相似度。
- 应用一种新颖的物体度量准则,根据边界框所有边上的强梯度对候选框进行排序,偏好紧凑且定位准确的区域。
- 从高分激活区域生成伪真实边界框,并使用多重实例学习(MIL)损失训练一个类似 Faster-RCNN 的检测器。
- 利用词频和基于嵌入的排序(公式 7)从标题中挖掘高质量、开放词汇的可检测物体概念。
- 探索基于边缘的提议与类别激活图的融合,以提高定位精度。
实验结果
研究问题
- RQ1是否可以仅使用图像-标题对而无需任何边界框标注来有效训练目标检测器?
- RQ2模型是否能仅通过自然语言标题的弱监督,学习检测超出固定预定义词汇表的物体?
- RQ3基于边缘梯度的物体度量准则是否在生成高质量边界框提议方面优于现有弱监督方法?
- RQ4在仅使用噪声标题进行训练的情况下,检测器在多大程度上能泛化以检测达到 COCO 水平的物体?
- RQ5模型是否能成功识别并定位标准数据集中未包含的新型、常见且具有特征的物体,如“树桩”或“桌子”?
主要发现
- 所提出的物体度量准则在生成高质量边界框提议方面显著优于两种现有弱监督检测方法。
- 该方法在仅使用噪声图像标题进行训练的情况下,于 COCO 数据集上实现了 6.91% 的 mAP@0.50 IoU,证明了在具有挑战性的开放词汇设置下实现有效检测的能力。
- 通过公式 7 和词频排序所学习到的词汇表在 80 个 COCO 类别上实现了高召回率(见图 7),表明有效发现了相关物体概念。
- 该模型成功检测到“树桩”和“桌子”等标准 COCO 类别集之外的新型物体,证实了其开放词汇能力。
- 使用多重实例学习(MIL)损失可提升检测器在训练过程中对噪声标签的鲁棒性,增强泛化能力。
- 该方法在使用 COCO 训练时可泛化至 PASCAL VOC,表明其在弱监督下具备跨数据集的可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。