Skip to main content
QUICK REVIEW

[论文解读] TransVG++: End-to-End Visual Grounding with Language Conditioned Vision Transformer

Jiajun Deng, Zhengyuan Yang|arXiv (Cornell University)|Jun 14, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

该论文提出 TransVG++:一种纯 Transformer 架构的端到端视觉定位框架,用语言条件化的视觉 Transformer(LC-ViT)替代复杂且人工设计的特征融合模块,以实现视觉-语言表征的联合学习。通过将语言引导注意力机制集成到视觉 Transformer 主干网络的中间层,TransVG++ 在五个基准数据集上实现了最先进性能,准确率与效率均得到提升,表明基于自注意力机制的简单融合方法优于启发式融合机制。

ABSTRACT

In this work, we explore neat yet effective Transformer-based frameworks for visual grounding. The previous methods generally address the core problem of visual grounding, i.e., multi-modal fusion and reasoning, with manually-designed mechanisms. Such heuristic designs are not only complicated but also make models easily overfit specific data distributions. To avoid this, we first propose TransVG, which establishes multi-modal correspondences by Transformers and localizes referred regions by directly regressing box coordinates. We empirically show that complicated fusion modules can be replaced by a simple stack of Transformer encoder layers with higher performance. However, the core fusion Transformer in TransVG is stand-alone against uni-modal encoders, and thus should be trained from scratch on limited visual grounding data, which makes it hard to be optimized and leads to sub-optimal performance. To this end, we further introduce TransVG++ to make two-fold improvements. For one thing, we upgrade our framework to a purely Transformer-based one by leveraging Vision Transformer (ViT) for vision feature encoding. For another, we devise Language Conditioned Vision Transformer that removes external fusion modules and reuses the uni-modal ViT for vision-language fusion at the intermediate layers. We conduct extensive experiments on five prevalent datasets, and report a series of state-of-the-art records.

研究动机与目标

  • 解决视觉定位中启发式、人工设计的融合模块存在的局限性,这些模块容易过拟合特定数据分布并限制跨模态交互。
  • 通过用标准 Transformer 编码器堆叠结构替代复杂架构,简化多模态融合,实现更高效且泛化能力更强的特征学习。
  • 通过将语言条件化直接集成到视觉编码器的中间层,消除对外部融合模块的需求,实现端到端训练并提升参数效率。
  • 通过从 CNN-Transformer 混合架构转向完全基于 Transformer 的设计,提升模型效率与可扩展性,减少计算瓶颈。
  • 通过统一、可解释且参数高效的框架,在多个视觉定位基准上实现最先进性能。

提出的方法

  • 提出 TransVG,一种初步的端到端视觉定位框架,利用标准 Transformer 编码器堆叠结构执行联合视觉-语言推理,无需外部融合模块。
  • 引入语言条件化视觉 Transformer(LC-ViT),将语言嵌入注入视觉 Transformer 主干网络的中间层,实现在多尺度上的多模态融合。
  • 通过可学习的 [REG] 标记直接回归边界框坐标,避免使用区域提议或锚框。
  • 采用基于视觉 Transformer(ViT)的视觉编码器进行视觉特征提取,替代卷积主干网络,实现完全基于 Transformer 的架构。
  • 采用轻量级语言适配器以降低参数量与计算成本,对整体模型效率影响可忽略不计。
  • 采用统一的训练范式,使整个模型可端到端训练,实现视觉与语言表征的联合优化。

实验结果

研究问题

  • RQ1一个简单的标准 Transformer 编码器堆叠结构能否有效替代视觉定位中复杂且手工设计的融合模块?
  • RQ2将语言条件化集成到视觉 Transformer 主干网络的中间层是否能提升多模态表征学习与定位准确率?
  • RQ3完全基于 Transformer 的架构是否能在视觉定位任务中超越混合 CNN-Transformer 设计,同时保持或降低计算成本?
  • RQ4与现有最先进模型相比,该方法在包含复杂指代表达的多样化基准上的表现如何?
  • RQ5所提出的组件(如语言适配器和 LC-ViT)在模型效率与参数效率方面的贡献程度如何?

主要发现

  • TransVG++ 在五个标准视觉定位基准上实现最先进性能,包括 RefCOCO、RefCOCO+ 和 RefCOCOg,优于先前方法。
  • 在 TransVG++(base)中,视觉分支(LViT)占总 FLOPs 的 97.7%,凸显视觉特征处理的计算主导地位。
  • 在 TransVG++(tiny)中,语言适配器仅引入 0.92G FLOPs,占语言条件化视觉分支计算的 4.99%,占整个模型 FLOPs 的 3.64%。
  • 定性结果表明,[REG] 标记能清晰且可解释地关注到目标对象,TransVG++ 生成的注意力图比初步的 TransVG 更清晰、更准确。
  • 消融实验表明,用简单的 Transformer 堆叠结构替代复杂融合模块可带来更高性能,并在多样化指代表达中实现更好泛化能力。
  • 模型对复杂语言结构(如空间关系与长句描述)表现出强鲁棒性,挑战性示例中的成功定位结果已得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。