[论文解读] VQA-E: Explaining, Elaborating, and Enhancing Your Answers for Visual Questions
本文提出了 VQA-E,这是视觉问答领域的一项新任务,要求模型在预测答案的同时生成文本解释。通过利用 VQA v2 数据集中图像字幕自动生成的解释,作者提出了一种多任务学习模型,在提升答案准确率的同时生成可解释、可辩护的响应,其在 VQA v2 基准测试中优于当前最先进方法。
Most existing works in visual question answering (VQA) are dedicated to improving the accuracy of predicted answers, while disregarding the explanations. We argue that the explanation for an answer is of the same or even more importance compared with the answer itself, since it makes the question and answering process more understandable and traceable. To this end, we propose a new task of VQA-E (VQA with Explanation), where the computational models are required to generate an explanation with the predicted answer. We first construct a new dataset, and then frame the VQA-E problem in a multi-task learning architecture. Our VQA-E dataset is automatically derived from the VQA v2 dataset by intelligently exploiting the available captions. We have conducted a user study to validate the quality of explanations synthesized by our method. We quantitatively show that the additional supervision from explanations can not only produce insightful textual sentences to justify the answers, but also improve the performance of answer prediction. Our model outperforms the state-of-the-art methods by a clear margin on the VQA v2 dataset.
研究动机与目标
- 为解决现有 VQA 系统中可解释性与论证不足的问题,提出新任务 VQA-E,要求模型为答案生成文本解释。
- 基于 VQA v2 数据集中的图像字幕与问题-答案对,构建高质量、自动生成的解释数据集。
- 证明将解释生成作为辅助任务,通过多任务学习可提升答案预测性能。
- 通过用户研究验证合成解释的质量,尤其评估其在不同问题类型下的相关性与信息量。
- 开发一种新型多任务模型,联合优化答案预测与解释生成,从而提升可解释性与准确率。
提出的方法
- 通过基于规则与注意力机制的技术,从 VQA v2 的图像字幕与对应的问题-答案对中自动构建 VQA-E 数据集,合成解释内容。
- 提出一种多任务学习架构,模型同时预测答案并生成文本解释,两个分支共享视觉与文本特征。
- 模型采用双分支编码器结构:一个分支用于答案预测,另一个用于解释生成,两者共享图像与问题编码器。
- 解释生成分支使用交叉熵损失进行训练,答案预测分支使用标准分类损失,两者均由合成数据监督。
- 在 VQA v2 数据集上使用自下而上与自上而下的视觉特征对模型进行微调,并通过消融实验隔离解释监督的影响。
- 开展用户研究以评估合成解释的质量,重点关注不同问题类型下解释的相关性、清晰度与信息量。
实验结果
研究问题
- RQ1能否从图像字幕自动生成的文本解释有效支撑 VQA 预测并提升模型性能?
- RQ2在答案预测与解释生成上联合训练,是否能提升对视觉内容的定位与理解能力?
- RQ3合成解释的质量在不同问题类型中如何变化,尤其是主观性或基于常识的问题?
- RQ4解释监督能否在仅使用注意力机制的基础上进一步提升答案准确率?
- RQ5解释质量对模型性能有何影响——无关或低质量的解释是否会降低性能?
主要发现
- VQA-E 模型在 VQA v2 数据集上达到 66.31% 的测试标准准确率,优于当前最先进方法 BUTD(65.67%)的总体准确率。
- 与基线模型相比,该模型在 'Other' 类答案类型上准确率提升最高达 1.73 个百分点,在 'Yes/No' 问题上提升达 2.22 个百分点。
- 消融实验表明,QI-AE-Bottom-up 搭配相关解释的模型准确率为 63.51%,而随机解释版本下降至 58.74%,证明解释质量直接影响性能表现。
- 定性分析表明,VQA-E 模型能更准确地定位相关图像区域,其注意力图与解释内容高度对齐(例如,在喂食场景中聚焦于手部区域)。
- 用户研究结果表明,合成解释在视觉基础问题上质量较高,但在需要语用知识的主观或常识性问题上效果较弱。
- 该模型生成的解释不仅是答案的论证,还包含对答案的扩展或增强,例如通过指定 'madonna shirt' 来澄清模糊术语。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。