Skip to main content
QUICK REVIEW

[论文解读] Visual Grounding with Transformers

Ye Du, Zehua Fu|arXiv (Cornell University)|May 10, 2021
Multimodal Machine Learning Applications被引用 8
一句话总结

本文提出VGTR,一种新颖的端到端基于Transformer的视觉定位框架,无需依赖预训练目标检测器或语言模型。通过引入文本引导的自注意力机制,学习与语言语义对齐的上下文感知视觉特征,VGTR在四个基准测试中达到最先进性能,显著优于以往无需提议的方法,包括在Flickr30K Entities数据集上实现4.89%的准确率提升。

ABSTRACT

In this paper, we propose a transformer based approach for visual grounding. Unlike previous proposal-and-rank frameworks that rely heavily on pretrained object detectors or proposal-free frameworks that upgrade an off-the-shelf one-stage detector by fusing textual embeddings, our approach is built on top of a transformer encoder-decoder and is independent of any pretrained detectors or word embedding models. Termed VGTR -- Visual Grounding with TRansformers, our approach is designed to learn semantic-discriminative visual features under the guidance of the textual description without harming their location ability. This information flow enables our VGTR to have a strong capability in capturing context-level semantics of both vision and language modalities, rendering us to aggregate accurate visual clues implied by the description to locate the interested object instance. Experiments show that our method outperforms state-of-the-art proposal-free approaches by a considerable margin on five benchmarks while maintaining fast inference speed.

研究动机与目标

  • 解决依赖预训练检测器或存在上下文建模能力不足的提议-排序与无提议视觉定位方法的局限性。
  • 开发一种独立于目标检测器和预训练语言模型的端到端视觉定位框架。
  • 通过一种新颖的注意力机制,利用语言语义引导学习具有判别性的视觉特征,从而提升定位准确率。
  • 通过双流Transformer架构联合推理视觉与语言特征,实现强大的跨模态理解。

提出的方法

  • VGTR采用四模块架构:视觉与文本编码器用于标记化,双流定位编码器用于跨模态交互,以文本标记作为查询的定位解码器,以及边界框回归头。
  • 核心创新是文本引导的自注意力机制,其取代视觉流中的标准自注意力,实现视觉特征与语言上下文的对齐,同时不损害空间定位能力。
  • 通过直接从图像-文本对回归目标边界框坐标,实现端到端训练,避免生成候选提议的需要。
  • 视觉与文本特征之间的交叉注意力实现联合推理与上下文级语义对齐。
  • 定位解码器动态关注与查询相关的视觉标记,基于语言描述细化特征表示。
  • 该框架通过边界框坐标的标准回归损失进行端到端训练,实现对定位性能的直接优化。

实验结果

研究问题

  • RQ1基于Transformer的视觉定位模型是否能在不依赖预训练目标检测器或语言模型的情况下实现最先进性能?
  • RQ2文本引导的自注意力机制在通过将视觉特征与语言语义对齐方面,能否有效提升视觉特征学习能力?
  • RQ3无提议、端到端的Transformer框架是否在视觉定位任务中优于现有无提议与有提议方法?
  • RQ4联合跨模态推理在复杂或模糊指代表达中的定位准确率提升方面,其作用程度如何?

主要发现

  • 在Flickr30K Entities数据集上,VGTR使用ResNet50时,准确率比ReSC-Large高出4.89%,显著优于最强的无提议基线方法。
  • 在RefCOCO数据集上,VGTR使用ResNet101在验证集上达到78.70%的准确率,验证集上比ReSC-Large高出1.67%,测试B集上高出2.08%。
  • 消融实验表明,文本引导的自注意力机制至关重要,其将RefCOCO上的准确率从79.24%提升至82.09%,证明其在上下文感知特征学习中的有效性。
  • 当N=2层时模型达到最优性能,表明超过一定深度后收益递减,因此N=2被选为默认设置。
  • 定性分析显示,VGTR在定位背景物体、不显眼实例以及复杂场景中的物体方面表现优异,而这些情况正是先前模型失败的典型场景。
  • 失败案例通常源于对否定('not')的误解,表明模型在理解语言中逻辑否定方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。