Skip to main content
QUICK REVIEW

[论文解读] Do Explanations make VQA Models more Predictable to a Human?

Arjun Chandrasekaran, Viraj Prabhu|arXiv (Cornell University)|Oct 29, 2018
Multimodal Machine Learning Applications参考文献 21被引用 8
一句话总结

本文研究了机器生成的解释是否能提升人类对视觉问答(VQA)模型行为的可预测性。通过在亚马逊机械 Turk 上开展的人机协同实验发现,尽管对模型的熟悉度能显著提升人类预测的准确性,但现有的解释模态(如注意力图或自然语言解释)并未显著增强可预测性,这挑战了‘解释能提升人机协作’的假设。

ABSTRACT

A rich line of research attempts to make deep neural networks more transparent by generating human-interpretable 'explanations' of their decision process, especially for interactive tasks like Visual Question Answering (VQA). In this work, we analyze if existing explanations indeed make a VQA model -- its responses as well as failures -- more predictable to a human. Surprisingly, we find that they do not. On the other hand, we find that human-in-the-loop approaches that treat the model as a black-box do.

研究动机与目标

  • 评估机器生成的解释是否能提升人类预测 VQA 模型行为的能力。
  • 探究解释是否能增强人类对模型成功、失败及响应的理解。
  • 比较不同解释模态与人类熟悉度在提升模型可预测性方面的有效性。
  • 评估人机交互动态在协作决策场景中的作用。
  • 挑战‘解释本质上能提升人机团队中的信任或可用性’这一假设。

提出的方法

  • 采用基于 Lu 等人(2016)的 VQA 模型(Vicki),在 VQA-1.0 数据集上进行训练,可访问图像和问题的注意力图。
  • 在亚马逊机械 Turk 上开展人类受试者研究,评估失败预测(FP)和知识预测(KP)任务。
  • 向参与者提供两种支持形式:(1)训练阶段以熟悉模型行为;(2)接触多种解释模态(如注意力图、自然语言解释)。
  • 通过 FP(正确/错误预测)和 KP(精确答案预测)的准确率指标衡量预测表现。
  • 收集人口统计学和 AI 素养数据,分析背景因素对模型可预测性的影响。
  • 采用受控实验设计,随机分配图像-问题对及解释条件,以隔离解释与熟悉度的影响。

实验结果

研究问题

  • RQ1解释模态(如注意力图、自然语言解释)是否能提升人类预测 VQA 模型响应的能力?
  • RQ2使人类熟悉 VQA 模型行为是否能提升其预测模型成功与失败的能力?
  • RQ3在不依赖解释的情况下,人类在多大程度上能预测 VQA 模型的精确答案?
  • RQ4是否存在特定的模型特征(如对主导颜色的偏好、对问题首词的依赖),人类可通过暴露学习到其可预测性?
  • RQ5在交互式场景中,解释的存在如何影响人类对模型可靠性与可预测性的感知?

主要发现

  • 人类对 VQA 模型响应和失败的预测能力显著优于随机猜测,尤其在完成训练阶段后。
  • 对模型行为的熟悉度显著提升了人类在失败预测与知识预测任务中的表现。
  • 尽管广泛使用,注意力图和自然语言解释等解释模态并未提升人类预测的准确性。
  • 该模型表现出一致的偏见——如在‘颜色’类问题中偏好主导颜色,或依赖问题的首词——人类可通过暴露学习到这些模式。
  • 人类对模型行为的预测能力并未因解释的存在而增强,表明解释可能未能实现其提升人机协作的预期目标。
  • 人口统计学与 AI 素养因素(如编程经验、对 AI 系统的熟悉度)与更好的预测表现相关,表明用户背景会影响模型的可预测性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。