Skip to main content
QUICK REVIEW

[论文解读] Grounding Visual Explanations (Extended Abstract)

Lisa Anne Hendricks, Ronghang Hu|arXiv (Cornell University)|Nov 17, 2017
Multimodal Machine Learning Applications参考文献 7被引用 3
一句话总结

本文提出了一种短语批评模型,通过在图像和生成的解释中定位单个属性短语,提升视觉解释的质量,确保图像相关性的同时保持语言流畅性。通过使用翻转短语作为负样本的相对属性排序损失,该模型在定位准确率上显著优于先前方法(85% vs. 79% 的图像相关属性),并生成了更准确、可解释且基于视觉证据的解释。

ABSTRACT

Existing models which generate textual explanations enforce task relevance through a discriminative term loss function, but such mechanisms only weakly constrain mentioned object parts to actually be present in the image. In this paper, a new model is proposed for generating explanations by utilizing localized grounding of constituent phrases in generated explanations to ensure image relevance. Specifically, we introduce a phrase-critic model to refine (re-score/re-rank) generated candidate explanations and employ a relative-attribute inspired ranking loss using "flipped" phrases as negative examples for training. At test time, our phrase-critic model takes an image and a candidate explanation as input and outputs a score indicating how well the candidate explanation is grounded in the image.

研究动机与目标

  • 为解决神经网络生成的文本解释中缺乏图像相关性的问题,即模型可能提及输入图像中不存在的属性。
  • 解决生成具有类别区分性的解释与确保这些解释在输入图像中具有视觉基础之间的矛盾。
  • 开发一种联合优化语言流畅性与解释短语视觉基础的框架。
  • 通过学习的评分机制自动选择最相关的图像解释,该机制评估短语的视觉定位效果。

提出的方法

  • 使用基于LSTM的模型,通过判别性损失进行训练,强调类别特定属性,生成一系列候选解释。
  • 使用基于规则的切分器将每个解释分解为属性短语(例如,'红色鸟喙'、'黑色面部')。
  • 使用预训练的定位模型(来自 hu2017modeling)将每个短语定位到图像中的视觉区域,返回一个边界框和一个定位得分。
  • 短语批评模型接收每个(短语,区域,得分)三元组,并计算一个单一的图像相关性得分 $ S_r $,反映该短语在图像中定位的优劣。
  • 使用相对属性排序损失对短语批评模型进行训练,将‘翻转’短语(例如,将‘红色’改为‘黑色’)作为负样本,以提升判别能力。
  • 最终通过加权组合短语批评得分 $ S_r $ 和流畅性得分 $ S_f = \log P(w_{0:T}) $ 对解释进行排序,避免过度青睐语法错误但视觉上合理的句子。

实验结果

研究问题

  • RQ1模型能否有效评估生成的文本解释是否在输入图像中具有视觉基础,而不仅仅是语言流畅性?
  • RQ2如何在不损害语言质量或区分能力的前提下,提高视觉解释的图像相关性?
  • RQ3将单个短语在图像中进行定位,在多大程度上能提升视觉解释的整体准确性和可解释性?
  • RQ4通过相对属性比较(例如,'红色' vs. '黑色')进行训练的批评模型,是否能比标准损失函数更好地识别图像无关的解释?

主要发现

  • 短语批评模型实现了85%的图像相关属性提及准确率,显著优于基线模型(79%)的短语定位准确率。
  • 该模型成功识别并纠正了错误提及——例如,当鸟喙实际为‘黑色’时,将其错误标记为‘橙色’——其依据正是视觉定位。
  • 排名靠前的解释始终提及最具区分性和视觉准确性的属性,例如‘白色眼睛’,这是布雷尔黑鸟的关键区分特征。
  • 流畅性评分($ S_f $)的整合有效防止模型偏好语法错误但视觉上合理的解释,例如重复提及‘长脖子’两次的句子。
  • 系统生成的视觉解释能精确地定位小区域(例如,‘白色眼睛’),并使用颜色编码的边界框与对应短语匹配。
  • 即使正确和错误的解释都提到了图像中存在的属性,该短语批评模型仍能通过利用相对属性比较有效地区分正确与错误解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。