Skip to main content
QUICK REVIEW

[论文解读] More Grounded Image Captioning by Distilling Image-Text Matching Model

Yuanen Zhou, Meng Wang|arXiv (Cornell University)|Apr 1, 2020
Multimodal Machine Learning Applications参考文献 70被引用 12
一句话总结

本文提出 POS-SCAN,一种基于词性标注的图像-文本匹配模型,通过知识蒸馏提升图像字幕模型中视觉注意力定位的性能,而无需昂贵的词-区域对齐标注。通过使用 SCAN 作为弱监督教师模型,并利用词性标注过滤非名词词,该方法显著提升了定位准确率,同时保持或提升了字幕质量,在 Flickr30k Entities 和 MS-COCO 基准上达到最先进性能。

ABSTRACT

Visual attention not only improves the performance of image captioners, but also serves as a visual interpretation to qualitatively measure the caption rationality and model transparency. Specifically, we expect that a captioner can fix its attentive gaze on the correct objects while generating the corresponding words. This ability is also known as grounded image captioning. However, the grounding accuracy of existing captioners is far from satisfactory. To improve the grounding accuracy while retaining the captioning quality, it is expensive to collect the word-region alignment as strong supervision. To this end, we propose a Part-of-Speech (POS) enhanced image-text matching model (SCAN \cite{lee2018stacked}): POS-SCAN, as the effective knowledge distillation for more grounded image captioning. The benefits are two-fold: 1) given a sentence and an image, POS-SCAN can ground the objects more accurately than SCAN; 2) POS-SCAN serves as a word-region alignment regularization for the captioner's visual attention module. By showing benchmark experimental results, we demonstrate that conventional image captioners equipped with POS-SCAN can significantly improve the grounding accuracy without strong supervision. Last but not the least, we explore the indispensable Self-Critical Sequence Training (SCST) \cite{Rennie_2017_CVPR} in the context of grounded image captioning and show that the image-text matching score can serve as a reward for more grounded captioning \footnote{https://github.com/YuanEZhou/Grounded-Image-Captioning}.

研究动机与目标

  • 在不依赖昂贵的词-区域对齐标注的前提下,提升图像字幕模型中的视觉注意力定位性能。
  • 通过更精确的注意力定位,提升神经图像字幕模型的可解释性与透明度。
  • 探究图像-文本匹配模型是否可作为有效弱监督信号,用于提升字幕模型中的定位性能。
  • 研究在强化学习中使用匹配分数作为奖励时,字幕质量与定位性能之间的权衡关系。

提出的方法

  • 提出 POS-SCAN,即对 SCAN 图像-文本匹配模型进行改进,通过词性标注器过滤非名词词,以提升定位准确率。
  • 将 POS-SCAN 模型作为教师模型,通过注意力蒸馏损失,将其知识蒸馏到字幕模型(如 Up-Down)的视觉注意力模块中。
  • 通过最小化学生字幕模型与教师 POS-SCAN 模型之间的注意力图差异,实现知识蒸馏。
  • 将图像-文本匹配分数(SCAN 或 POS-SCAN)作为强化学习中的奖励函数,集成到自Critical Sequence Training (SCST) 中,以优化字幕生成的定位性能。
  • 采用两阶段训练策略:先使用交叉熵损失进行预训练,再使用匹配分数作为奖励进行 SCST 微调。
  • 采用自下而上的视觉特征,并结合注意力准确率与标准评估指标(BLEU、METEOR、CIDEr、SPICE)进行综合评估。

实验结果

研究问题

  • RQ1弱监督图像-文本匹配模型是否能在无词-区域标注的情况下,提升图像字幕模型中的视觉注意力定位性能?
  • RQ2在匹配分数中过滤非名词词是否能提升图像-文本匹配模型的定位性能?
  • RQ3图像-文本匹配分数是否可作为 SCST 中的有效奖励,以平衡字幕质量与定位性能?
  • RQ4当使用不同匹配分数作为奖励时,字幕质量与定位性能之间是否存在权衡关系?

主要发现

  • POS-SCAN 在 Flickr30k Entities 上达到 19.83% 的注意力准确率,优于原始 SCAN(17.63%),并达到与 Up-Down 字幕模型相当的水平,证明了在无强监督条件下定位性能的显著提升。
  • 使用 POS-SCAN 作为奖励微调的字幕模型在 Flickr30k Entities 上达到 17.49% 的 F1_loc,显著优于仅使用 CIDEr 作为奖励的模型。
  • 与基线模型相比,该方法将 SPICE 分数提升 1.5 分(从 66.2 提升至 69.3),F1_loc 提升 1.7 分(从 15.79 提升至 17.49),且无需真实注意力监督。
  • 在 MS-COCO Karpathy 测试集上,模型达到 80.2 B@1、38.0 B@4 和 28.5 M 的指标,F1_loc 为 22.2,各项指标表现强劲。
  • 在 SCST 中使用 SCAN 作为奖励,其定位性能优于仅使用 CIDEr 的奖励,而 POS-SCAN 在字幕质量与定位性能之间提供了更优的平衡。
  • 定性分析显示,该方法生成的注意力图更加准确,能正确将 "men" 和 "shirt" 等词语与图像中的对应区域对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。