Skip to main content
QUICK REVIEW

[论文解读] Visual Semantic Reasoning for Image-Text Matching

Kunpeng Li, Yulun Zhang|arXiv (Cornell University)|Sep 6, 2019
Multimodal Machine Learning Applications参考文献 40被引用 21
一句话总结

本文提出视觉语义推理网络(VSRN),一种新颖模型,通过图卷积网络(GCNs)进行基于区域的语义推理,以及通过门控与记忆机制实现全局语义推理,从而提升图像-文本匹配性能。该方法生成可解释的高层视觉表征,捕捉关键物体与关系,在MS-COCO与Flickr30K数据集上实现最先进性能,图像检索任务相对提升分别为6.8%与12.6%。

ABSTRACT

Image-text matching has been a hot research topic bridging the vision and language areas. It remains challenging because the current representation of image usually lacks global semantic concepts as in its corresponding text caption. To address this issue, we propose a simple and interpretable reasoning model to generate visual representation that captures key objects and semantic concepts of a scene. Specifically, we first build up connections between image regions and perform reasoning with Graph Convolutional Networks to generate features with semantic relationships. Then, we propose to use the gate and memory mechanism to perform global semantic reasoning on these relationship-enhanced features, select the discriminative information and gradually generate the representation for the whole scene. Experiments validate that our method achieves a new state-of-the-art for the image-text matching on MS-COCO and Flickr30K datasets. It outperforms the current best method by 6.8% relatively for image retrieval and 4.8% relatively for caption retrieval on MS-COCO (Recall@1 using 1K test set). On Flickr30K, our model improves image retrieval by 12.6% relatively and caption retrieval by 5.8% relatively (Recall@1). Our code is available at https://github.com/KunpengLi1994/VSRN.

研究动机与目标

  • 通过引入高层语义概念增强图像表征,以缓解图像-文本匹配中的视觉-语义差异。
  • 建模图像中局部区域关系与全局语义关联,以实现与文本描述更好的对齐。
  • 设计一种简单且可解释的推理机制,超越局部CNN特征,提升特征表征能力。
  • 通过注意力可视化验证所学图像表征是否捕捉到文本标题中的关键物体与语义关系。
  • 在标准图像-文本匹配基准上实现最先进性能。

提出的方法

  • 模型使用Faster R-CNN提取显著图像区域作为推理输入。
  • 构建连接图像区域的图拓扑结构,并应用图卷积网络(GCNs)传播并丰富蕴含语义关系的特征。
  • 引入门控与记忆机制,执行全局语义推理,选择性关注判别性特征,并逐步构建整体图像表征。
  • 通过基于与全局表征相似度的可微注意力机制,聚合区域特征以计算最终图像表征。
  • 通过可视化最终图像表征与各区域之间的注意力分数,解释模型行为。
  • 采用对比排序损失端到端训练模型,以优化图像-文本匹配性能。

实验结果

研究问题

  • RQ1一种建模图像区域间关系的推理机制是否能提升图像-文本匹配中的视觉-语义对齐?
  • RQ2使用门控与记忆机制的全局语义推理是否能增强图像表征的判别能力?
  • RQ3模型内部的推理过程是否可解释,以验证其是否捕捉到文本标题中的关键语义概念?
  • RQ4基于推理的表征是否优于依赖局部特征或成对注意力机制的现有方法?
  • RQ5该模型在标准基准中对复杂与杂乱场景的泛化能力如何?

主要发现

  • 在MS-COCO数据集上,VSRN在图像检索任务中实现6.8%的相对提升(1K测试集上的Recall@1),在字幕检索任务中实现4.8%的相对提升,优于此前最先进方法。
  • 在Flickr30K数据集上,模型在图像检索任务中实现12.6%的相对提升,在字幕检索任务中实现5.8%的相对提升(Recall@1),表现出强大泛化能力。
  • 定性结果表明,模型在复杂场景中也能在前3名内检索到正确匹配,注意力图清晰突出关键物体与语义概念。
  • 注意力可视化结果证实,模型最终表征与包含关键语义概念的区域具有强相关性,验证了其可解释性。
  • 模型能有效区分视觉上相似的图像,例如基于语义线索准确区分‘人正在擦车’与‘人正在滑雪’的场景。
  • 结果表明,通过推理增强的全局表征在图像-文本匹配任务中比复杂的成对注意力机制更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。