[论文解读] Greedy Gradient Ensemble for Robust Visual Question Answering
本文提出贪婪梯度集成(GGE),一种模型无关的框架,通过顺序集成有偏见的模型来减少视觉问答(VQA)中的语言偏见,从而提升视觉定位能力。通过贪婪地过拟合有偏见的数据分布,GGE促使基础模型聚焦于困难样本,在VQA-CP上实现了SOTA性能,相比基线模型准确率提升17.34%,且无需额外标注。
Language bias is a critical issue in Visual Question Answering (VQA), where models often exploit dataset biases for the final decision without considering the image information. As a result, they suffer from performance drop on out-of-distribution data and inadequate visual explanation. Based on experimental analysis for existing robust VQA methods, we stress the language bias in VQA that comes from two aspects, i.e., distribution bias and shortcut bias. We further propose a new de-bias framework, Greedy Gradient Ensemble (GGE), which combines multiple biased models for unbiased base model learning. With the greedy strategy, GGE forces the biased models to over-fit the biased data distribution in priority, thus makes the base model pay more attention to examples that are hard to solve by biased models. The experiments demonstrate that our method makes better use of visual information and achieves state-of-the-art performance on diagnosing dataset VQA-CP without using extra annotations.
研究动机与目标
- 分析VQA中语言偏见的根本原因,识别出两种不同的形式:分布偏见和捷径偏见。
- 解决现有去偏方法未能充分利用视觉和语言信息的局限性。
- 开发一种可泛化的、模型无关的框架,提升模型对分布外数据的鲁棒性,并增强视觉解释能力。
- 证明贪婪地过拟合有偏见模型可使基础模型聚焦于困难的、视觉定位相关的样本。
- 验证GGE在不依赖额外标注的情况下,同时提升准确率和视觉解释质量。
提出的方法
- GGE将语言偏见分解为分布偏见(长尾答案分布)和捷径偏见(虚假的QA相关性),并分步解决。
- 该框架采用贪婪策略,依次在过拟合语言先验的数据上训练有偏见的模型,迫使基础模型从困难样本中学习。
- GGE在函数空间中集成多个有偏见的模型,模拟梯度下降过程,以优化基础模型的预测结果。
- 它采用联合表示 $ r_i = m(e_v(v_i), e_q(q_i)) $ 作为自集成(GGE-SF)的有偏见特征,实现模型无关的应用。
- 该方法采用两阶段流程:首先去除分布偏见(GGE-D),然后结合捷径偏见减少(GGE-DQ),以提升泛化能力。
- GGE兼容多种损失函数(如BCE、CE)和基础模型(如UpDn、BAN、S-MRL),展现出广泛的适用性。
实验结果
研究问题
- RQ1VQA中的语言偏见能否有意义地分解为分布偏见和捷径偏见,且二者在影响模型性能方面是否具有互补性?
- RQ2一种贪婪集成策略,通过过拟合有偏见模型,是否能提升基础模型对视觉定位困难样本的关注?
- RQ3GGE能否在不使用额外标注或人工标注视觉解释的情况下,实现在VQA-CP上的SOTA性能?
- RQ4GGE在提升视觉解释质量方面的有效性如何,以注意力定位和预测置信度为衡量标准?
- RQ5GGE在不同基础模型和损失函数上的泛化能力如何?
主要发现
- 在VQA-CP基准上,GGE相较于UpDn基线模型实现了17.34%的准确率提升,证明了其在无需额外标注情况下的SOTA性能。
- GGE-DQ变体在VQA-CP上实现了56.25%的整体准确率,显著优于基线模型和现有SOTA方法。
- 定性分析表明,GGE-DQ改善了视觉定位能力,能正确识别出相关图像区域(如长颈鹿吃树叶、水中的电视),而基线模型则失败。
- 自集成变体(GGE-SF)在无需预定义有偏见特征的情况下实现了44.53%的准确率,证明了GGE的泛化能力。
- 消融实验确认,分布偏见和捷径偏见的减少均必不可少且具有互补性,以实现最优性能。
- GGE在不同基础模型(UpDn、BAN、S-MRL)和损失函数(BCE、CE)上均保持强劲性能,证实了其模型无关和损失无关的设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。