Skip to main content
QUICK REVIEW

[论文解读] Visual Grounding Methods for VQA are Working for the Wrong Reasons!

Robik Shrestha, Kushal Kafle|arXiv (Cornell University)|Apr 12, 2020
Multimodal Machine Learning Applications参考文献 23被引用 5
一句话总结

本文表明,近期用于VQA的视觉定位方法提升性能的原因并非更好的视觉对齐,而是通过正则化减少了对语言偏见的依赖。作者提出一种简单、无需标注的正则化方法——在训练过程中将真实答案置零——在VQA-CPv2上实现了接近最先进水平的准确率(48.9%),证明性能提升源于遗忘虚假先验,而非改进的视觉定位。

ABSTRACT

Existing Visual Question Answering (VQA) methods tend to exploit dataset biases and spurious statistical correlations, instead of producing right answers for the right reasons. To address this issue, recent bias mitigation methods for VQA propose to incorporate visual cues (e.g., human attention maps) to better ground the VQA models, showcasing impressive gains. However, we show that the performance improvements are not a result of improved visual grounding, but a regularization effect which prevents over-fitting to linguistic priors. For instance, we find that it is not actually necessary to provide proper, human-based cues; random, insensible cues also result in similar improvements. Based on this observation, we propose a simpler regularization scheme that does not require any external annotations and yet achieves near state-of-the-art performance on VQA-CPv2.

研究动机与目标

  • 探究VQA中的视觉定位方法是否真正提升了视觉对齐,还是通过正则化效应减少对语言偏见的依赖。
  • 挑战在有偏见的VQA基准上性能提升需依赖人工标注注意力图或显著性信号的假设。
  • 提出一种最小化、无需标注的正则化方案,在VQA-CPv2上实现最先进结果。
  • 倡导改进评估协议,以区分真正的视觉定位与由正则化引起的性能提升。
  • 呼吁构建更大规模、完全标注的定位数据集,或设立明确的定位评估任务,以验证模型行为。

提出的方法

  • 提出一种简单的正则化损失,强制模型在训练期间对所有答案预测零分,无论其正确与否。
  • 将总损失定义为标准BCE损失与正则项的组合:$ L := BCE(P(\mathcal{A}), \mathcal{A}_{gt}) + \lambda BCE(P(\mathcal{A}), \mathbf{0}) $,其中 $ \lambda = 1 $。
  • 在VQA-CPv2数据集的1%子集上训练模型,包括固定、随机重采样和完整数据集三种变体,以测试鲁棒性。
  • 比较在使用相关、无关或随机视觉线索训练的模型之间的性能,以隔离正则化效应与实际定位的差异。
  • 使用CPIG(正确预测在定位中的比例)等指标评估预测是否与相关视觉区域对齐。
  • 分析训练准确率的下降作为先验遗忘的代理指标,将其与在分布外数据上的测试性能提升相联系。

实验结果

研究问题

  • RQ1VQA中的视觉定位方法是否真正提升了视觉对齐,还是主要通过正则化减少对语言先验的依赖?
  • RQ2能否在不使用任何外部视觉线索或注意力图的情况下,实现VQA-CPv2上的性能提升?
  • RQ3在有偏见的VQA基准上,提升泛化能力是否必须依赖人工标注的注意力图或显著性图?
  • RQ4一种简单正则化方案,对所有预测施加相等惩罚,是否能超越复杂的基于定位的方法?
  • RQ5模型能否在不提升训练准确率的情况下实现VQA-CPv2的最先进性能,表明其并未真正实现定位?

主要发现

  • 视觉定位方法带来的性能提升并非源于更好的视觉对齐,而是源于减少对语言先验过拟合的正则化。
  • 在随机或无关视觉区域上进行注意力训练的模型,在VQA-CPv2上的准确率提升与使用人工标注线索的模型相当。
  • 在使用相关、无关或随机线索训练的模型之间,预测结果的差异在统计上不显著,表明缺乏有意义的视觉定位。
  • 所提出的零正则化方法在VQA-CPv2上实现了48.9%的准确率,无需任何视觉线索或标注,达到最先进水平。
  • 所有测试方法均显示出训练准确率显著下降,表明其并非真正实现定位——真正的定位不会损害训练性能。
  • CPIG指标显示,即使使用人工标注线索,HINT和SCR模型中仅有29.76%和19.78%的正确预测与视觉区域对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。