[论文解读] Towards Robust Visual Question Answering: Making the Most of Biased Samples via Contrastive Learning
本文提出MMBS,一种对比学习方法,通过利用有偏见的训练样本而非丢弃它们,增强了视觉问答(VQA)任务的鲁棒性。通过构建去偏正样本并区分有偏见与无偏见的数据,MMBS在分布外数据(VQA-CP v2)上提升了泛化能力,同时保持了在分布内数据(VQA v2)上的性能,解决了VQA中常见的分布内-分布外准确率权衡问题。
Models for Visual Question Answering (VQA) often rely on the spurious correlations, i.e., the language priors, that appear in the biased samples of training set, which make them brittle against the out-of-distribution (OOD) test data. Recent methods have achieved promising progress in overcoming this problem by reducing the impact of biased samples on model training. However, these models reveal a trade-off that the improvements on OOD data severely sacrifice the performance on the in-distribution (ID) data (which is dominated by the biased samples). Therefore, we propose a novel contrastive learning approach, MMBS, for building robust VQA models by Making the Most of Biased Samples. Specifically, we construct positive samples for contrastive learning by eliminating the information related to spurious correlation from the original training samples and explore several strategies to use the constructed positive samples for training. Instead of undermining the importance of biased samples in model training, our approach precisely exploits the biased samples for unbiased information that contributes to reasoning. The proposed method is compatible with various VQA backbones. We validate our contributions by achieving competitive performance on the OOD dataset VQA-CP v2 while preserving robust performance on the ID dataset VQA v2.
研究动机与目标
- 解决现有去偏方法导致的VQA模型在分布内-分布外性能权衡问题。
- 克服VQA数据集中对语言先验的过度依赖,该依赖会损害模型在分布外测试集上的泛化能力。
- 开发一种方法,在保留有偏样本有用性的同时,减少其对模型泛化能力的有害影响。
- 使VQA模型在保持高分布内准确率的同时,实现在语言偏见敏感的分布外基准(如VQA-CP v2)上的优异表现。
- 提供一种可泛化的、与主干网络无关的框架,兼容多种VQA架构和去偏策略。
提出的方法
- 通过从原始训练样本中移除与语言先验相关的信息,构建两类去偏正样本,同时保留与任务相关的视觉和语言特征。
- 设计四种不同的训练策略,以在对比学习中有效利用构建的正样本。
- 提出一种新颖算法,自动将样本分类为有偏或无偏,从而在对比学习过程中实现差异化处理。
- 制定一种辅助对比目标,使原始样本与其去偏正样本在跨模态嵌入空间中的距离最小化。
- 在训练过程中应用该对比目标,以促使模型学习到更通用、更鲁棒的表示,减少对虚假相关性的依赖。
- 通过将对比模块作为即插即用组件集成,确保与多种VQA主干网络和现有去偏方法的兼容性。
实验结果
研究问题
- RQ1我们能否在不降低分布内(ID)数据性能的前提下,提升VQA模型在分布外(OOD)数据上的鲁棒性?
- RQ2我们能否有效利用有偏训练样本而非抑制它们,以减少语言先验的影响?
- RQ3如何设计一种对比学习框架,以区分有偏与无偏样本,从而提升泛化能力?
- RQ4所提出的方法是否在标准VQA基准上保持强性能的同时,也在如VQA-CP v2这类偏见敏感的分布外基准上表现优异?
- RQ5基于去偏正样本的对比学习策略是否能带来与相关视觉和语言线索更一致的注意力对齐?
主要发现
- 所提出的MMBS方法在分布外基准VQA-CP v2上取得了具有竞争力的性能,同时在分布内数据集VQA v2上保持了高准确率,成功解决了ID-OOD性能权衡问题。
- 与现有去偏基线方法(如LMH和RUBi)相比,MMBS在VQA-CP v2上的表现更优,且答案分布与测试集的对齐程度更高。
- 注意力可视化显示,MMBS将注意力从有偏问题类别词(如“color”)转移到更具信息量的主体词(如“flip flop”),从而降低了对语言先验的依赖。
- 与LMH不同,该模型在VQA v2中常见且有偏的样本上仍保持了强劲性能,后者因有偏数据提供的监督减弱而性能下降。
- 辅助对比目标成功缩小了原始样本与正样本之间在嵌入空间中的距离,促进了更鲁棒的表示学习。
- 该方法兼容多种VQA主干网络和去偏技术,展现出广泛的适用性和良好的泛化潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。