[论文解读] Learning from Lexical Perturbations for Consistent Visual Question Answering
本文提出了一种用于视觉问答(VQA)的新颖一致性正则化方法,通过受控的词汇扰动提升模型鲁棒性。通过在经过最小语言变化(如同义词替换、释义或反义词替换)的配对问题上进行训练,该方法利用模块权重一致性损失强制模型在答案和中间推理步骤上保持相似性,显著提升了在各类扰动类型下的推理一致性与泛化能力。
Existing Visual Question Answering (VQA) models are often fragile and sensitive to input variations. In this paper, we propose a novel approach to address this issue based on modular networks, which creates two questions related by linguistic perturbations and regularizes the visual reasoning process between them to be consistent during training. We show that our framework markedly improves consistency and generalization ability, demonstrating the value of controlled linguistic perturbations as a useful and currently underutilized training and regularization tool for VQA models. We also present VQA Perturbed Pairings (VQA P2), a new, low-cost benchmark and augmentation pipeline to create controllable linguistic variations of VQA questions. Our benchmark uniquely draws from large-scale linguistic resources, avoiding human annotation effort while maintaining data quality compared to generative approaches. We benchmark existing VQA models using VQA P2 and provide robustness analysis on each type of linguistic variation.
研究动机与目标
- 解决现有 VQA 模型对微小语言变化(如同义词替换或反义词变化)的脆弱性。
- 通过在语义相关问题间强制保持一致的推理步骤,提升模型的泛化能力与鲁棒性。
- 利用大规模语言资源而非人工标注,开发一种低成本、高质量的数据增强流水线。
- 构建一个新的基准 VQA P2,系统评估模型对受控语言扰动的鲁棒性。
- 证明在中间推理步骤上强制一致性(而不仅限于最终答案)可带来更可靠、可解释性更强的 VQA 模型。
提出的方法
- 使用神经模块网络(NMNs)显式表示视觉推理为一系列模块化操作(如目标检测、空间推理)的序列。
- 利用大规模语料库中的基于规则的词汇替换生成扰动问题对,保持语义含义与分布现实性。
- 提出一种新型正则化损失 Q3R,最小化每个推理步骤中原问题与扰动问题在模块权重分布之间的 L2 差异。
- 端到端联合训练模型,同时使用标准 VQA 损失与 Q3R 一致性损失,以鼓励语义相关问题采用相同的推理路径。
- 利用公开可用的语言资源(如 WordNet、同义词数据库)自动生成多样化、高质量的扰动,无需人工标注。
- 设计 VQA P2 作为基准数据集,包含从 VQA v2 衍生的 36.2k 个扰动问题对,按同义、释义和反义类型分类,用于诊断性评估。
实验结果
研究问题
- RQ1当面对语义相关但语言形式改变的问题时,现有 VQA 模型在保持一致推理方面失败的程度如何?
- RQ2在中间推理步骤上强制一致性(而不仅限于最终答案)是否能提升模型对词汇扰动的鲁棒性?
- RQ3基于大规模语料库中自动化的基于规则的词汇替换的数据增强策略,相较于人工标注或生成方法,效果如何?
- RQ4所提出的 Q3R 正则化方法是否在各类语言变异类型下均带来可测量的一致性与准确率提升?
- RQ5该框架是否可泛化至其他依赖可执行推理程序的可解释、模块化 VQA 架构,而不仅限于 NMNs?
主要发现
- Q3R 正则化方法将原始问题与扰动问题之间模块权重分布的平均归一化差异降低了 93%,从 7.4×10⁻³ 降至 0.5×10⁻³,表明推理步骤具有极强的一致性。
- 在 VQA P2 基准上,经 Q3R 正则化的模型在反义词扰动上的一致性得分(CS)提升了 9.4% 的绝对值,同义词对中最高提升达 10.2%,相较基线模型表现显著。
- 使用 Q3R 的 StackNMN 在反义词对上的 CS 达 84.7,较基线模型提升 10.6 分,表明在具有挑战性的反义语义问题上鲁棒性显著增强。
- 该方法在整体 VQA v2 验证集准确率上带来微小但一致的增益,不同架构下最高提升达 1.6 分,表明具有更广泛的泛化优势。
- 在人类标注的重述问题(VQA-Rephrasings)上评估时,经 Q3R 正则化的 XNM 模型实现了 +0.7 的准确率增益与 +0.4 的 CS 提升,表明其在真实世界重述任务中具备良好的迁移能力。
- Q3R 正则化模型的视觉注意力图显示出更直观、更稳定的注意力模式,表明其可解释性与推理保真度得到提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。