[论文解读] Learning Object Detection from Captions via Textual Scene Attributes
本文提出了一种新颖的弱监督目标检测方法,通过从图像字幕中提取的文本场景图来提升检测精度。通过引入一种纠缠损失(entanglement loss),将视觉目标检测器与文本属性(例如 '红色笔记本电脑')对齐,该模型在 MS COCO 和 Pascal VOC 2007 上实现了最先进性能,显著优于以往基于字幕的方法,且无需边界框标注。
Object detection is a fundamental task in computer vision, requiring large annotated datasets that are difficult to collect, as annotators need to label objects and their bounding boxes. Thus, it is a significant challenge to use cheaper forms of supervision effectively. Recent work has begun to explore image captions as a source for weak supervision, but to date, in the context of object detection, captions have only been used to infer the categories of the objects in the image. In this work, we argue that captions contain much richer information about the image, including attributes of objects and their relations. Namely, the text represents a scene of the image, as described recently in the literature. We present a method that uses the attributes in this "textual scene graph" to train object detectors. We empirically demonstrate that the resulting model achieves state-of-the-art results on several challenging object detection datasets, outperforming recent approaches.
研究动机与目标
- 为解决弱监督目标检测(WSOD)中缺乏边界框标注的问题,通过利用图像字幕中超越简单物体标签的更丰富信息。
- 通过利用字幕中描述的文本场景属性(如颜色、形状和空间关系)来指导目标定位,从而提升检测性能。
- 开发一种新颖的训练目标,强制预测的视觉属性与字幕中描述的属性保持一致,以增强场景级理解。
- 证明字幕中的属性级监督可显著优于仅依赖物体标签提取的方法,即使不引入额外训练数据。
提出的方法
- 该方法使用预训练的文本到场景图(text-to-SG)模型从图像字幕中提取文本场景图(SGs),以捕获物体、其属性及相互关系。
- 提出一种新颖的纠缠损失,强制预测的视觉物体特征与字幕中描述的属性保持一致,例如红色物体应与 '红色' 属性相关联。
- 模型采用双分支架构:一个用于图像特征提取和候选区域生成,另一个用于从相同特征中预测视觉属性。
- 使用类似 Faster R-CNN 的主干网络进行目标检测,并在训练过程中应用纠缠损失,以对齐视觉预测与文本属性。
- 该方法采用精确字符串匹配进行物体标签提取(如 Ye 等,2019 年),但额外引入基于场景图的纠缠损失,以优化定位与分类。
- 该方法在图像-字幕对上端到端训练,无需边界框标注,仅使用图像级标签和文本描述。
实验结果
研究问题
- RQ1能否有效利用图像字幕中的文本场景属性,以超越简单物体标签监督的方式提升弱监督目标检测性能?
- RQ2通过新颖损失函数强制视觉物体特征与文本属性保持一致,是否能带来更高的检测精度?
- RQ3当仅使用图像字幕作为监督信号时,基于字幕的检测模型性能与全监督基线相比如何?
- RQ4来自字幕的属性级监督能否超越仅专注于提升伪标签质量的方法?
主要发现
- 在使用 COCO Captions 训练并在 VOC 2007 测试集上评估时,所提出的 EM + SG Loss 模型实现了 45.9 的 mAP,接近使用真实 COCO 标注训练的全监督 WSOD 模型的 46.3 mAP。
- 在 COCO test-dev 数据集上,该模型实现了最先进水平的 mAP@0.5:0.95,展现出强大的跨数据集泛化能力。
- 当在 Flickr30K 字幕上训练并在 VOC 2007 上评估时,该模型的性能相比 EM + TextClsf 基线提升了四倍,且未引入额外训练数据。
- 作为训练过程的副产品,模型的属性分类器表现出有意义的性能,表明属性理解在训练过程中被有效捕获。
- 消融实验确认,纠缠损失是性能提升的关键因素,移除该损失后性能退化至基线 ExactMatch 水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。