[论文解读] Grid-VLP: Revisiting Grid Features for Vision-Language Pre-training
该论文提出 Grid-VLP,一种视觉语言预训练方法,用预训练 CNN(如 ResNeXt)提取的基于网格的卷积特征替代基于区域的特征,实现更快、更简单且更高效的跨模态学习。尽管仅使用了域内数据(MS-COCO 和 Visual Genome),Grid-VLP 在 VQA、NLVR2 和 GQA 上的表现优于大多数基于区域的 VLP 模型,甚至超越了端到端的 PixelBERT,证明了基于网格的特征在高效且高性能 VLP 中的巨大潜力。
Existing approaches to vision-language pre-training (VLP) heavily rely on an object detector based on bounding boxes (regions), where salient objects are first detected from images and then a Transformer-based model is used for cross-modal fusion. Despite their superior performance, these approaches are bounded by the capability of the object detector in terms of both effectiveness and efficiency. Besides, the presence of object detection imposes unnecessary constraints on model designs and makes it difficult to support end-to-end training. In this paper, we revisit grid-based convolutional features for vision-language pre-training, skipping the expensive region-related steps. We propose a simple yet effective grid-based VLP method that works surprisingly well with the grid features. By pre-training only with in-domain datasets, the proposed Grid-VLP method can outperform most competitive region-based VLP methods on three examined vision-language understanding tasks. We hope that our findings help to further advance the state of the art of vision-language pre-training, and provide a new direction towards effective and efficient VLP.
研究动机与目标
- 解决现有基于区域的视觉语言预训练(VLP)方法中对象检测器带来的效率低下与限制问题。
- 探究基于网格的卷积特征是否可作为 VLP 中基于区域特征的可行且更优的替代方案。
- 通过消除对目标检测的依赖,实现更快、更简单且端到端可训练的 VLP 模型。
- 在不使用复杂数据增强或微调技巧的情况下,评估基于网格的特征在标准视觉语言理解基准上的性能。
提出的方法
- Grid-VLP 使用预训练的 CNN(如 ResNeXt)从图像中提取基于网格的特征图,而非依赖对象检测器生成的区域提议。
- 通过类似于 LXMERT 的双流 Transformer 架构,直接在文本标记与二维网格特征图之间进行跨模态融合。
- 在预训练过程中应用随机网格采样机制,以减少序列长度并加速训练,同时提升对长视觉序列的鲁棒性。
- 模型在 MS-COCO 和 Visual Genome 上进行预训练,采用标准的 VLP 目标:掩码语言建模、图文匹配和图文问答。
- 图像分辨率设置为将短边缩放到 600,长边最大为 1000,每张图像在预训练过程中采样 100 个随机网格。
- 训练使用 8 张 V100 GPU,批量大小为 512,优化器为 AdamW,基础初始学习率为 $10^{-4}$,共训练 30 个周期。
实验结果
研究问题
- RQ1在不依赖对象检测器的前提下,基于网格的卷积特征是否能在视觉语言预训练中超越基于区域的特征?
- RQ2图像编码器主干网络的选择(如 ResNeXt-50、-101、-152)如何影响基于网格的 VLP 性能?
- RQ3输入图像分辨率对 Grid-VLP 的准确率和推理速度有何影响?
- RQ4仅使用域内预训练数据,简单的基于网格的方法能否实现最先进性能?
主要发现
- Grid-VLP 在所有三个下游任务(VQA、NLVR2 和 GQA)上均优于大多数竞争性的基于区域的 VLP 方法,且无需数据增强或对抗性训练。
- 在 VQA v2.0 基准上,使用 ResNeXt-152 的 Grid-VLP 达到 76.05% 的准确率,超越了基于区域的 ResNeXt-152 基线(75.12%),且特征提取时间显著更低。
- 使用更小的输入图像尺寸(448×448)可实现 3 倍的加速,同时 VQA 准确率仅下降 0.34%(相比完整的 600×1000 分辨率)。
- 将图像编码器深度从 ResNeXt-50 增加到 ResNeXt-152,使 VQA 准确率从 74.34% 提升至 76.05%,证实了强大视觉主干网络的重要性。
- 仅使用域内预训练数据,Grid-VLP 在 GQA 和 NLVR2 上实现了最先进性能,优于使用大规模域外检测数据的模型。
- 模型对随机网格采样具有鲁棒性,当采样网格数从 100 减少到 64 或 128 时,性能无显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。