Skip to main content
QUICK REVIEW

[论文解读] Faithful Multimodal Explanation for Visual Question Answering

Jialin Wu, Raymond J. Mooney|arXiv (Cornell University)|Sep 8, 2018
Multimodal Machine Learning Applications参考文献 32被引用 9
一句话总结

本文提出了一种忠实的多模态解释框架,用于视觉问答(VQA),该框架将文本解释与VQA模型实际关注的图像区域相连接。通过使用与VQA系统注意力一致的人类解释进行训练,并利用Grad-CAM实现答案视觉解释与解释之间的对齐,该方法在VQA-X基准上实现了显著更高的忠实度和人类理解度,相比之前的方法,不忠实度降低了17%,忠实度得分为56%。

ABSTRACT

AI systems' ability to explain their reasoning is critical to their utility and trustworthiness. Deep neural networks have enabled significant progress on many challenging problems such as visual question answering (VQA). However, most of them are opaque black boxes with limited explanatory capability. This paper presents a novel approach to developing a high-performing VQA system that can elucidate its answers with integrated textual and visual explanations that faithfully reflect important aspects of its underlying reasoning while capturing the style of comprehensible human explanations. Extensive experimental evaluation demonstrates the advantages of this approach compared to competing methods with both automatic evaluation metrics and human evaluation metrics.

研究动机与目标

  • 开发一种VQA系统,生成反映其实际推理过程的解释,而非仅模仿人类解释。
  • 确保文本解释忠实于模型在预测过程中实际关注的视觉特征。
  • 整合视觉与文本解释,使解释中的词语指向推理过程中使用的相关图像区域。
  • 通过使系统的推理过程透明且易于理解,提升用户信任度。
  • 使用自动化度量(LIME、Grad-CAM)和人工评估来评估忠实度。

提出的方法

  • 该模型使用带有自下而上-自上而下注意力机制的预训练VQA模块,生成答案预测并关注相关图像区域。
  • 通过将序列模型基于问题、答案和VQA模型关注的视觉特征进行条件化,生成文本解释。
  • 在训练过程中,仅使用与VQA模型注意力一致的人类解释,其一致性通过基于Grad-CAM的视觉解释对齐来确定。
  • 引入一个忠实度损失 $\mathcal{L}_f$,以对齐基于梯度的文本解释视觉解释与预测答案的视觉解释。
  • 通过基于梯度的方法(Grad-CAM)将解释链接到图像区域,确保解释中的词语指向模型实际关注的视觉对象。
  • 系统通过LIME验证所关注区域的忠实度,过滤掉与VQA模型注意力不一致的解释。

实验结果

研究问题

  • RQ1多模态解释系统能否生成忠实于VQA模型实际关注视觉特征的文本解释?
  • RQ2强制VQA模型注意力与解释的视觉焦点对齐,如何提升忠实度?
  • RQ3与随机采样的解释相比,与模型推理一致的人类标注解释在多大程度上能提升解释质量?
  • RQ4自动化忠实度度量(LIME和Grad-CAM)能否可靠地衡量多模态解释的忠实度?
  • RQ5视觉与文本解释的整合在多大程度上能增强人类对VQA系统的理解与信任?

主要发现

  • 仅使用经过Grad-CAM一致性过滤的忠实人类解释,将基于LIME的忠实度得分从K=1时的0.588(随机)提升至0.636,加入忠实度损失后进一步提升。
  • 加入忠实度损失 $\mathcal{L}_f$ 后,基于Grad-CAM的忠实度得分从过滤后的0.45提升至0.56,相对提升11%。
  • 在使用忠实解释和 $\mathcal{L}_f$ 时,解释与答案视觉解释之间余弦相似度的分布显示,低于0.1的得分比例减少了17%,表明不忠实度降低。
  • 在使用过滤后的解释和 $\mathcal{L}_f$ 时,K=1下LIME-based忠实度得分为0.686,表明与关键图像区域高度对齐。
  • 人工评估确认,与之前方法相比,该方法的解释更具可理解性和忠实度,尤其在将词语与相关图像区域关联方面表现更优。
  • 该方法在自动化度量和人工评估中均优于基线模型,证实忠实度能有效提升VQA系统的信任度与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。