[论文解读] Improving VQA and its Explanations \\ by Comparing Competing Explanations
该论文提出了一种新颖的框架,通过比较每个答案候选的竞 competing 文本解释,来提升视觉问答(VQA)及其解释的质量。通过在人类提供的解释上进行联合训练,并利用检索或生成的解释重新加权答案置信度,该方法增强了推理能力,减少了对捷径学习的依赖,在 VQA-X 数据集上实现了最先进(SOTA)的性能,相比基线模型提升了 1.1%。
Most recent state-of-the-art Visual Question Answering (VQA) systems are opaque black boxes that are only trained to fit the answer distribution given the question and visual content. As a result, these systems frequently take shortcuts, focusing on simple visual concepts or question priors. This phenomenon becomes more problematic as the questions become complex that requires more reasoning and commonsense knowledge. To address this issue, we present a novel framework that uses explanations for competing answers to help VQA systems select the correct answer. By training on human textual explanations, our framework builds better representations for the questions and visual content, and then reweights confidences in the answer candidates using either generated or retrieved explanations from the training set. We evaluate our framework on the VQA-X dataset, which has more difficult questions with human explanations, achieving new state-of-the-art results on both VQA and its explanations.
研究动机与目标
- 解决 VQA 系统因过度关注答案先验或简单视觉概念而采取捷径的问题,而非正确推理。
- 通过利用文本解释作为监督信号,提升复杂、需要常识推理的问题上的 VQA 性能。
- 通过基于其他答案的竞 competing 解释来条件化解释生成,提升解释质量。
- 实现端到端训练,联合优化答案预测、解释检索与解释生成。
- 通过提供与人类推理模式一致的推理过程,提升模型的透明度与可信度。
提出的方法
- 该框架采用双分支网络来编码问题、图像和解释,共享表示以实现联合训练。
- 引入一种验证损失,通过各自解释比较正确答案与竞争答案的置信度。
- 基于解释质量与相关性的学习验证分数,重新加权原始 VQA 预测结果。
- 为每个答案候选检索或生成解释,并通过对比学习机制利用它们来优化最终预测。
- 该方法可端到端训练,可与任意可微分的 VQA 模型(如 Up-Down 或 LXMERT)集成。
- 通过基于竞争答案的检索解释来条件化解释生成,提升了忠实度与连贯性。
实验结果
研究问题
- RQ1通过比较竞争性文本解释,能否提升复杂、推理密集型问题上的 VQA 性能?
- RQ2使用多个答案候选的解释,能否减少基于答案先验或视觉线索的捷径学习?
- RQ3检索或生成的解释能否作为有效监督,同时提升答案预测与解释质量?
- RQ4解释质量对最终 VQA 性能的影响有多大?检索的解释能多接近人工标注的版本?
- RQ5通过基于竞争答案的解释来条件化解释生成,能否提升解释生成质量?
主要发现
- 所提方法在 VQA-X 数据集上实现了最先进性能,通过使用竞争解释重新加权,相比最佳基线模型提升了 1.1%。
- 消融实验表明,即使不进行重新加权,仅通过解释监督带来的表示改进,性能也提升了 3.6%。
- 使用检索解释代替人工黄金标准解释,准确率仅下降 0.6%,表明其近似质量极佳。
- 通过最小化验证损失,使解释特征与 VQA 预测对齐,模型学习到更优的视觉与问题表示。
- 通过基于竞争解释的条件化,解释生成质量得到提升,在自动评估与人工评估中均优于先前最先进方法。
- 该框架通过验证损失中的正则化组件,成功减少了对问题或视觉先验的过度依赖,从而抑制了捷径学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。