Skip to main content
QUICK REVIEW

[论文解读] Question-Conditioned Counterfactual Image Generation for VQA

Jingjing Pan, Yash Goyal|arXiv (Cornell University)|Nov 14, 2019
Advanced X-ray and CT Imaging参考文献 14被引用 11
一句话总结

本文提出了一种针对视觉问答(VQA)任务的问题条件化反事实图像生成框架,可生成经过最小程度修改、视觉上逼真的图像,使VQA模型预测出不同答案。该方法采用基于图像、问题和真实答案的LingUNet架构,结合对抗性损失、L2损失和交叉熵损失,生成语义相关的编辑内容——尤其在与颜色相关的问题上表现突出,使VQA准确率从64.33%降至57.64%,在'什么颜色'问题上进一步降至34.02%。

ABSTRACT

While Visual Question Answering (VQA) models continue to push the state-of-the-art forward, they largely remain black-boxes - failing to provide insight into how or why an answer is generated. In this ongoing work, we propose addressing this shortcoming by learning to generate counterfactual images for a VQA model - i.e. given a question-image pair, we wish to generate a new image such that i) the VQA model outputs a different answer, ii) the new image is minimally different from the original, and iii) the new image is realistic. Our hope is that providing such counterfactual examples allows users to investigate and understand the VQA model's internal mechanisms.

研究动机与目标

  • 通过生成反事实图像来解决VQA模型的黑箱问题,以解释模型决策过程。
  • 通过展示微小图像变化如何导致不同答案,提供具有区分性且人类可理解的解释。
  • 确保生成的反事实图像与原始图像差异最小且视觉上逼真。
  • 精确地根据问题对图像编辑进行条件控制,以确保相关性与语义一致性。
  • 通过可控扰动使用户能够探究影响VQA模型预测的视觉特征。

提出的方法

  • 使用LingUNet架构,基于输入图像、问题和真实答案生成反事实图像。
  • 通过将VQA模型的语言编码和最终答案logits拼接后经全连接层投影,对生成器进行条件控制。
  • 采用三种损失进行训练:负交叉熵损失以使VQA模型预测远离原始答案,L2损失以最小化像素级差异,以及对抗性判别器以增强图像的真实性。
  • 训练过程中应用梯度裁剪和软标签,以稳定GAN训练并避免对抗性伪影。
  • 在引入语言条件和完整损失优化前,先使用L2损失对生成器进行热启动。
  • 对判别器进行微调,以防止出现如'深度梦境'效应等伪影,确保感知质量。

实验结果

研究问题

  • RQ1我们能否生成反事实图像,使VQA模型输出不同答案,同时保持视觉真实感?
  • RQ2该模型在生成与输入问题和原始答案语义相关编辑方面有多高效?
  • RQ3生成的编辑在多大程度上与人类对语义变化的感知一致?
  • RQ4模型在不同问题类型上的表现如何,特别是'什么颜色'问题与其他语义类别相比?
  • RQ5模型能否将编辑定位到相关图像区域,还是会对无关对象过度编辑?

主要发现

  • 在验证集上,当使用生成的反事实图像评估时,VQA模型准确率从64.33%降至57.64%,表明实现了有效的语义改变。
  • 对于'什么颜色'问题,准确率从72.64%显著下降至34.02%,证明了在生成与颜色相关的反事实图像方面表现强劲。
  • 该模型成功改变了与颜色相关问题的答案预测,且VQA系统与人类标注者均感知到新颜色与原色不同。
  • 对于非颜色类问题,模型通常无法有意义地改变VQA预测,或生成的编辑对人类不可见,导致标注者意见不一致。
  • 观察到对无关图像区域的过度编辑(如图2c中改变衬衫颜色),表明编辑缺乏空间定位能力。
  • 部分输出中存在棋盘状伪影,但经过大量判别器微调后,整体真实感得以保持,有效避免了对抗性伪影。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。