QUICK REVIEW
[论文解读] Learning Rich Image Region Representation for Visual Question Answering
Bei Liu, Zhicheng Huang|arXiv (Cornell University)|Oct 29, 2019
Multimodal Machine Learning Applications参考文献 14被引用 8
一句话总结
本文提出了一种VQA框架,通过增强视觉与文本特征表示来提升性能。通过使用更强的ResNeXt-152主干网络配合FPN和多尺度训练进行目标检测,并用BERT替代GloVe以实现上下文感知的问题编码,该方法在VQA 2.0 test-std数据集上达到74.89%的准确率,在VQA Challenge 2019中获得第二名。
ABSTRACT
We propose to boost VQA by leveraging more powerful feature extractors by improving the representation ability of both visual and text features and the ensemble of models. For visual feature, some detection techniques are used to improve the detector. For text feature, we adopt BERT as the language model and find that it can significantly improve VQA performance. Our solution won the second place in the VQA Challenge 2019.
研究动机与目标
- 通过增强视觉与文本特征的表征能力来提升视觉问答(VQA)性能。
- 解决标准目标检测器和浅层文本编码器在捕捉丰富、上下文感知表征方面的局限性。
- 研究先进特征提取器(特别是更深的主干网络和预训练语言模型)对VQA准确率的影响。
- 通过辅助监督(属性头)和多尺度训练等训练技术优化视觉特征提取。
- 通过模型集成和在VQA 2.0基准上的消融研究,展示最先进性能。
提出的方法
- 在Visual Genome 1.2数据集上使用ResNeXt-152和FPN主干网络训练Faster R-CNN检测器,并使用ImageNet预训练权重进行初始化。
- 在训练过程中引入属性预测头以增强视觉特征表示,推理时移除该头。
- 在检测器训练过程中应用多尺度训练,以提升检测的鲁棒性和泛化能力。
- 将GloVe替换为BERT-base作为语言模型,以获得问题的深度双向上下文表征。
- 使用BERT-base的最终层隐藏状态提取token级别的问题特征,并调整输入维度以匹配BAN模型。
- 使用20个训练周期的调度策略和5e-5的初始微调初始速率,对BAN模型进行微调,其中BERT模块的参数进行微调。
实验结果
研究问题
- RQ1更强的视觉特征提取器(如结合FPN的ResNeXt-152和多尺度训练)是否能显著提升VQA性能?
- RQ2将GloVe替换为BERT作为文本编码器,在VQA 2.0基准上能多大程度上提升VQA准确率?
- RQ3在视觉特征提取过程中使用属性监督在多大程度上能提升表征质量?
- RQ4当将改进后的视觉与文本特征表示整合到强VQA模型(如BAN)中时,其综合影响如何?
- RQ5模型集成是否能进一步放大增强特征表示的收益,从而实现最先进结果?
主要发现
- 使用ResNeXt-152配合FPN和多尺度训练,使VQA准确率在test-dev数据集上提升至71.68%,显著优于ResNet-101基线模型。
- 检测器训练过程中引入的属性头带来了超过4%的性能提升,证明其在增强视觉特征质量方面的有效性。
- 将GloVe替换为BERT-base在所有设置下均使VQA准确率提升超过1个百分点,最佳单模型在test-dev上达到72.79%。
- 使用BERT特征的20个模型集成在test-dev上达到74.71%的准确率,在test-std上达到74.89%,在VQA Challenge 2019中获得第二名。
- 消融研究证实,BERT、FPN、多尺度训练和属性头每个组件均对最终性能提升有增量贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。