[论文解读] MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering
该论文提出MUTANT,一种训练范式,通过在图像或问题中引入感知相似但语义不同的输入变异,提升视觉问答(VQA)模型在分布外(OOD)场景下的泛化能力。通过在投影答案表征上使用噪声对比估计损失,强制模型在原始输入与变异输入上的预测保持一致,MUTANT在VQA-CP-v2基准上实现了69.52%的新SOTA准确率,较之前方法提升10.57%。
While progress has been made on the visual question answering leaderboards, models often utilize spurious correlations and priors in datasets under the i.i.d. setting. As such, evaluation on out-of-distribution (OOD) test samples has emerged as a proxy for generalization. In this paper, we present MUTANT, a training paradigm that exposes the model to perceptually similar, yet semantically distinct mutations of the input, to improve OOD generalization, such as the VQA-CP challenge. Under this paradigm, models utilize a consistency-constrained training objective to understand the effect of semantic changes in input (question-image pair) on the output (answer). Unlike existing methods on VQA-CP, MUTANT does not rely on the knowledge about the nature of train and test answer distributions. MUTANT establishes a new state-of-the-art accuracy on VQA-CP with a $10.57\%$ improvement. Our work opens up avenues for the use of semantic input mutations for OOD generalization in question answering.
研究动机与目标
- 解决依赖虚假数据集偏差和语言先验的VQA模型在分布外场景下泛化能力差的问题。
- 在不丢弃有用归纳偏置的前提下缓解负向偏差(虚假相关性),通过隐式教导模型识别关键输入变化。
- 在无需事先知晓训练/测试答案分布的情况下,提升在OOD基准(如VQA-CP-v2)上的鲁棒性。
- 通过训练结构化的语义变异输入图像-问题对,使模型能够学习‘如果…会怎样’的推理能力。
- 建立一种新的训练范式,通过输入变异与一致性学习,放大正向偏置并隐式削弱负向偏置。
提出的方法
- 模型在成对样本上进行训练:原始输入(图像-问题)及其感知相似但语义不同的变异输入(如颜色改变、词语替换、否定等)。
- 通过投影层将跨模态特征与真实答案映射到共享潜在空间,以支持语义比较。
- 采用噪声对比估计(NCE)损失,最小化投影答案向量与投影输入特征之间的距离,强制原始与变异输入对之间的预测一致性。
- 类型暴露(Type Exposure)模块通过将特定问题类型的全部有效答案视为等概率候选,对预测进行正则化,降低对语言先验的依赖。
- 采用成对训练协议,确保模型在原始输入与变异输入上产生一致的预测,即使正确答案发生变化。
- 该框架无需显式去偏或了解训练集与测试集之间答案分布的变化。
实验结果
研究问题
- RQ1对输入图像-问题对进行结构化的语义变异,能否提升VQA在分布外场景下的泛化能力?
- RQ2如何在不依赖显式去偏的情况下,训练模型识别改变答案的关键输入变化?
- RQ3在原始输入与变异输入之间保持预测一致性,能否提升在VQA-CP-v2等OOD基准上的鲁棒性?
- RQ4在VQA中,通过放大正向偏置并隐式减少负向偏置,是否优于显式去偏方法?
- RQ5基于答案空间投影的一致性约束训练目标,是否能超越标准分类损失,实现更优的泛化性能?
主要发现
- MUTANT在VQA-CP-v2基准上实现了69.52%的新SOTA准确率,较之前最佳模型提升10.57%。
- 模型在标准VQA-V2数据集上达到70.24%的准确率,表明其在分布内与分布外场景下均具备强大性能。
- 该方法在无需事先知晓测试集答案分布或显式去偏的情况下,显著提升了泛化能力。
- 基于投影答案向量的NCE一致性损失,有效捕捉了语义相似性,并增强了对输入变异的鲁棒性。
- 类型暴露模块通过将特定问题类型的全部有效答案视为同等可能的候选,成功降低了对语言先验的依赖。
- 与使用随机对抗扰动的方法相比,该方法通过利用结构化、语义有意义的输入变异,实现了更优的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。