[论文解读] In Defense of Grid Features for Visual Question Answering
本文为基于网格的卷积特征在视觉问答(VQA)任务中的应用进行辩护,证明其在VQA 2.0基准上实现了最先进(SOTA)的准确率(测试-标准集上达到72.71%),同时比基于区域的特征快40倍以上。作者表明,通过在Visual Genome数据集上进行适当的预训练并使用高分辨率输入,网格特征在性能上可与基于区域的特征持平甚至超越,从而实现无需区域标注的端到端训练,并简化模型设计。
Popularized as 'bottom-up' attention, bounding box (or region) based visual features have recently surpassed vanilla grid-based convolutional features as the de facto standard for vision and language tasks like visual question answering (VQA). However, it is not clear whether the advantages of regions (e.g. better localization) are the key reasons for the success of bottom-up attention. In this paper, we revisit grid features for VQA, and find they can work surprisingly well - running more than an order of magnitude faster with the same accuracy (e.g. if pre-trained in a similar fashion). Through extensive experiments, we verify that this observation holds true across different VQA models (reporting a state-of-the-art accuracy on VQA 2.0 test-std, 72.71), datasets, and generalizes well to other tasks like image captioning. As grid features make the model design and training process much simpler, this enables us to train them end-to-end and also use a more flexible network design. We learn VQA models end-to-end, from pixels directly to answers, and show that strong performance is achievable without using any region annotations in pre-training. We hope our findings help further improve the scientific understanding and the practical application of VQA. Code and features will be made available.
研究动机与目标
- 挑战‘基于区域的特征在VQA中天然优于网格特征’这一假设。
- 探究自下而上的注意力机制的成功是否源于区域定位能力,还是源于预训练数据的规模和分辨率。
- 通过仅使用网格特征实现从像素到答案的端到端VQA训练,避免对区域标注的依赖。
- 证明网格特征在不同模型、数据集和任务(如图像字幕)中具有良好的泛化能力。
- 通过替换昂贵的区域提取步骤,简化模型设计并加速推理。
提出的方法
- 使用与基于区域的模型相同的Visual Genome数据集和高分辨率输入对网格特征进行预训练,确保比较的公平性。
- 从与区域特征相同的预训练检测器的同一层(fc6)提取网格特征,保持特征提取的一致性。
- 对网格特征应用金字塔池化模块(PPM),以捕捉多尺度上下文信息,从而在无需区域标注的情况下提升性能。
- 使用网格特征从原始像素到答案端到端训练VQA模型,绕过对区域级定位标注的需求。
- 使用标准的VQA和图像字幕基准(VQA 2.0、VizWiz、COCO)评估其在不同任务和模型间的泛化能力。
- 测量不同主干网络(ResNet、ResNeXt)、VQA模型(Pythia、MCAN)以及特征类型(网格 vs. 区域)下的推理速度和准确率。
实验结果
研究问题
- RQ1当在相同条件下进行预训练时,基于网格的特征是否能达到与基于区域的特征相当或更优的VQA准确率?
- RQ2基于区域特征的性能提升是源于更好的定位能力,还是源于预训练数据的规模和分辨率?
- RQ3是否可以仅使用网格特征成功实现端到端的VQA训练,而无需区域级别的标注?
- RQ4使用网格特征如何影响不同架构和任务下的推理速度与模型灵活性?
- RQ5网格特征是否在其他视觉-语言任务(如图像字幕)中也具有良好的泛化能力?
主要发现
- 网格特征在VQA 2.0基准上实现了72.71%的SOTA测试-标准集准确率,与或超过基于区域的模型。
- 当使用ResNet-50主干网络时,使用网格特征相比区域特征,推理速度提升40倍以上——从每张图像0.89秒降至0.02秒。
- 基于FPN的区域特征处理管道显著更慢(1.03秒 vs. 0.02秒),且在VQA准确率上并未优于更简单的C4或基于网格的方法。
- 网格特征在图像字幕任务中也表现出良好的泛化能力,在COCO Karpathy划分上达到BLEU-4分数88.46和CIDEr分数72.59,与基于区域的模型相当。
- 使用网格特征进行端到端训练可实现优异性能,且完全无需任何区域级别的标注,证明显式建模区域并非实现高准确率的必要条件。
- 消融研究证实,高性能的关键因素在于在Visual Genome上进行大规模预训练和使用高分辨率输入——而非特征格式(网格 vs. 区域)本身。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。