Skip to main content
QUICK REVIEW

[论文解读] Weakly-supervised Visual Grounding of Phrases with Linguistic Structures

Fanyi Xiao, Leonid Sigal|arXiv (Cornell University)|May 3, 2017
Multimodal Machine Learning Applications参考文献 47被引用 21
一句话总结

本文提出了一种弱监督视觉定位方法,仅使用图像级标题(image-level captions)而无需区域到短语的标注,即可在图像中定位自由形式的语言短语。该方法引入了一种新型深度神经网络,结合源自语言解析树的两种结构损失——父子包含性与兄弟排他性,显著提升了在 MS COCO 和 Visual Genome 数据集上的定位准确率,优于基线模型。

ABSTRACT

We propose a weakly-supervised approach that takes image-sentence pairs as input and learns to visually ground (i.e., localize) arbitrary linguistic phrases, in the form of spatial attention masks. Specifically, the model is trained with images and their associated image-level captions, without any explicit region-to-phrase correspondence annotations. To this end, we introduce an end-to-end model which learns visual groundings of phrases with two types of carefully designed loss functions. In addition to the standard discriminative loss, which enforces that attended image regions and phrases are consistently encoded, we propose a novel structural loss which makes use of the parse tree structures induced by the sentences. In particular, we ensure complementarity among the attention masks that correspond to sibling noun phrases, and compositionality of attention masks among the children and parent phrases, as defined by the sentence parse tree. We validate the effectiveness of our approach on the Microsoft COCO and Visual Genome datasets.

研究动机与目标

  • 解决在无区域到短语标注情况下的弱监督视觉定位挑战。
  • 利用自然语言描述的层次结构(通过解析树)提升定位准确率。
  • 仅使用图像级标题,实现对任意短语(包括复杂名词短语和形容词)的定位。
  • 设计一个统一的深度学习框架,将语言结构整合到视觉注意力掩码中。
  • 通过定位复杂指代表达,实现超越简单目标检测的泛化能力。

提出的方法

  • 使用包含语言编码器、视觉编码器和语义投影模块的神经网络,将短语和图像区域映射到共享嵌入空间。
  • 应用判别性损失,使注意力对齐的图像区域与共享语义空间中的对应短语对齐。
  • 引入父子结构损失,强制要求短语的注意力掩码是其子短语掩码的并集(组合性)。
  • 引入兄弟-兄弟结构损失,强制要求兄弟短语的注意力掩码在空间上互斥(互补性)。
  • 使用图像-句子对端到端训练模型,无需真实边界框或分割掩码。
  • 在推理时为任意输入短语生成像素级注意力掩码,即使为单个词或复杂短语。

实验结果

研究问题

  • RQ1语言解析树结构能否在无区域到短语标注的情况下提升弱监督视觉定位性能?
  • RQ2父子组合性与兄弟排他性约束对定位准确率的影响如何?
  • RQ3仅在图像级标题上训练的模型能否实现对复杂短语(超越简单名词)的准确定位?
  • RQ4与仅使用判别性损失或完全无结构的模型相比,结构约束的整合效果如何?
  • RQ5解析树错误或语言表征限制在多大程度上影响模型性能?

主要发现

  • 同时采用父子和兄弟排他性约束的模型(Ours)在 MS COCO 上达到最高的 mAP,优于仅使用判别性损失的基线模型及其他消融模型。
  • 父子(PC)和兄弟独立性(SIB)损失在所有 IOU 阈值下均单独提升了 mAP,证明其在将语言结构有效传递至视觉注意力方面的有效性。
  • 完整模型(Ours)在 MS COCO 和 Visual Genome 上均达到最先进性能,表明结构约束能显著提升定位准确率。
  • 与基线相比,该模型生成的注意力掩码更清晰、更精确,尤其在不规则形状物体和复杂短语上表现更优。
  • 该模型能为同一图像中的不同语言输入成功定位不同对象,证明其具备处理多样化指代表达的能力。
  • 失败案例主要源于错误的解析树(约 20% 的图像)、次优的语言表征,以及弱监督固有的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。