[论文解读] Saliency-Guided Attention Network for Image-Sentence Matching
本文提出了一种显著性引导的注意力网络(Saliency-Guided Attention Network, SAN),用于图像-句子匹配任务,利用视觉显著性作为引导,实现视觉与语言模态之间的非对称对齐。通过将显著性检测器与显著性加权视觉注意力(Saliency-weighted Visual Attention, SVA)模块及显著性引导的文本注意力(Saliency-guided Textual Attention, STA)模块相结合,SAN能够学习细粒度的跨模态相关性,在Flickr30K和MSCOCO数据集上实现了最先进性能,句子检索的R@1指标提升了19.2%。
This paper studies the task of matching image and sentence, where learning appropriate representations across the multi-modal data appears to be the main challenge. Unlike previous approaches that predominantly deploy symmetrical architecture to represent both modalities, we propose Saliency-guided Attention Network (SAN) that asymmetrically employs visual and textual attention modules to learn the fine-grained correlation intertwined between vision and language. The proposed SAN mainly includes three components: saliency detector, Saliency-weighted Visual Attention (SVA) module, and Saliency-guided Textual Attention (STA) module. Concretely, the saliency detector provides the visual saliency information as the guidance for the two attention modules. SVA is designed to leverage the advantage of the saliency information to improve discrimination of visual representations. By fusing the visual information from SVA and textual information as a multi-modal guidance, STA learns discriminative textual representations that are highly sensitive to visual clues. Extensive experiments demonstrate SAN can substantially improve the state-of-the-art results on the benchmark Flickr30K and MSCOCO datasets by a large margin.
研究动机与目标
- 通过利用视觉显著性作为引导,解决图像与句子在跨模态匹配中的语义鸿沟问题。
- 克服对称的、全局的特征表示所带来的局限性,这些表示会掩盖细粒度的视觉-文本对齐。
- 开发一种非对称注意力机制,其中视觉显著性引导文本注意力,以反映图像信息量更高的特性。
- 通过建模局部显著视觉区域及其与词语的语义对应关系,提升基准数据集上的检索性能。
提出的方法
- 使用轻量级显著性检测器生成视觉显著性图,用于引导两个注意力模块。
- 显著性加权视觉注意力(SVA)模块利用显著性图选择性地关注局部视觉特征,以增强判别性视觉表征。
- 显著性引导的文本注意力(STA)模块融合全局视觉特征、模态内文本特征与显著性信息,为词级别注意力生成多模态引导。
- 在SVA与STA中均采用软注意力机制,根据语义相关性动态分配重要性权重。
- 采用双向排序损失进行模型训练,以优化图像与句子对之间联合嵌入空间的对齐。
- 该架构实现了非对称的跨模态注意力,其中视觉引导语言模态,反映了图像具有更高的信息含量。
实验结果
研究问题
- RQ1视觉显著性能否提升图像与句子表征在跨模态匹配中的对齐效果?
- RQ2在图像-句子检索任务中,是否视觉引导语言的非对称注意力机制优于对称的双向注意力机制?
- RQ3将显著性图与视觉及文本注意力模块相结合,在增强细粒度跨模态相关性方面有多有效?
- RQ4与仅使用全局或模态内文本特征相比,显著性引导的文本注意力的贡献如何?
主要发现
- 仅使用显著性引导的文本注意力(STA)模块,即可使句子检索的R@1提升19.2%,图像检索的R@1提升15.4%(相对于基线)。
- 在STA模块中使用显著性增强的视觉特征(SV)相比使用全局视觉特征(GV),使图像检索的R@1绝对提升7.6%。
- 完整SAN模型在MSCOCO 1K测试集上实现85.4%的R@1(句子检索)和69.1%的R@1(图像检索),显著优于先前最先进方法。
- 定性结果表明,SVA与STA模块生成的可解释注意力热力图分别与显著图像区域和语义相关词语对齐。
- 采用两阶段训练(Stage-1与Stage-2)的模型在显著性检测与注意力定位方面表现更优,Stage-2生成的视觉注意力图更具连贯性与细粒度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。