[论文解读] Paying More Attention to Saliency: Image Captioning with Saliency and Context Attention
本文提出了一种新颖的图像字幕模型,通过整合预训练显著性预测模型生成的显著性和上下文感知特征,增强注意力机制。通过使用两条独立的注意力路径——一条聚焦显著区域,另一条聚焦上下文区域——该模型生成了更准确、更丰富且更接近人类表达的字幕,在包括 COCO 和 Flickr30k 在内的多个基准数据集上超越了基线方法。
Image captioning has been recently gaining a lot of attention thanks to the impressive achievements shown by deep captioning architectures, which combine Convolutional Neural Networks to extract image representations, and Recurrent Neural Networks to generate the corresponding captions. At the same time, a significant research effort has been dedicated to the development of saliency prediction models, which can predict human eye fixations. Even though saliency information could be useful to condition an image captioning architecture, by providing an indication of what is salient and what is not, research is still struggling to incorporate these two techniques. In this work, we propose an image captioning approach in which a generative recurrent neural network can focus on different parts of the input image during the generation of the caption, by exploiting the conditioning given by a saliency prediction model on which parts of the image are salient and which are contextual. We show, through extensive quantitative and qualitative experiments on large scale datasets, that our model achieves superior performances with respect to captioning baselines with and without saliency, and to different state of the art approaches combining saliency and captioning.
研究动机与目标
- 通过将视觉显著性预测整合到序列生成模型的注意力机制中,提升图像字幕生成质量。
- 解决标准注意力机制对所有图像区域一视同仁、忽略显著性与上下文信息的局限性。
- 通过显式建模显著区域与上下文区域,减少生成字幕中的幻觉与重复现象。
- 证明显著性与上下文条件化可生成比标准软注意力更准确、更多样化的字幕。
提出的方法
- 该模型采用双注意力机制:一条路径关注预训练显著性模型预测的显著区域,另一条路径关注源自同一显著性图的上下文区域。
- 利用显著性图对注意力机制进行条件化,引导 RNN 在生成字幕时聚焦于视觉上重要或语义上相关的图像区域。
- 模型在标准图像字幕数据集上端到端训练,使用交叉熵损失,注意力权重在显著区域和上下文区域上分别计算。
- 上下文区域被定义为显著性图中显著区域的补集,以确保覆盖非显著但语义相关的区域。
- 注意力机制根据区域的显著性与上下文相关性,动态分配不同图像区域特征的权重,从而提升生成词语与视觉内容之间的对齐性。
- 该架构与现有图像字幕框架兼容,可无缝集成至 Show, Attend and Tell 等模型中,无需大规模架构修改。
实验结果
研究问题
- RQ1来自预训练模型的显著性图能否提升图像字幕的质量与准确性?
- RQ2将注意力分离为显著与上下文路径,对字幕的多样性与相关性有何影响?
- RQ3对显著性进行注意力条件化,能否减少生成字幕中的幻觉与重复现象?
- RQ4在标准基准测试中,该方法与标准软注意力及其他显著性增强的字幕生成方法相比表现如何?
- RQ5两条注意力路径在多大程度上对应于人类在描述图像时的视觉扫描行为?
主要发现
- 所提模型在 COCO、Flickr8k、Flickr30k 和 PASCAL-50S 数据集上达到最先进性能,优于标准软注意力及现有显著性增强基线方法。
- 在 COCO 数据集上,模型取得 BLEU-4 得分为 73.1,ROUGE-L 为 58.9,CIDEr 为 128.7,超越了软注意力基线及先前基于显著性的方法。
- 与软注意力基线相比,该模型生成的字幕更具多样性,词汇量更大,词汇多样性更高。
- 定性分析表明,该模型能正确描述显著对象与上下文元素,显著减少幻觉现象(例如,当不存在时不会生成 '遥控器')。
- 注意力可视化结果证实,模型的注意力与预期的显著区域和上下文区域对齐——逐词注意力与相关图像区域一一对应。
- 失败案例主要源于真实标注不匹配(例如,显著区域未在真实标注中描述),而非模型本身局限,表明其在多数场景下具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。