Skip to main content
QUICK REVIEW

[论文解读] Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators

Kuang-Huei Lee, Hamid Palangi|arXiv (Cornell University)|Sep 22, 2019
Multimodal Machine Learning Applications参考文献 56被引用 33
一句话总结

论文提出了 R-SCAN 和一个基于关系的自顶向下标题生成器,利用神经场景图(视觉关系)特征来提升图像文本匹配和图像描述,使用 VrR-VG 而非 VG150 进行训练,在 Flickr30K 与 MSCOCO 的单模型表现上达到最先进的结果。

ABSTRACT

Grounding language to visual relations is critical to various language-and-vision applications. In this work, we tackle two fundamental language-and-vision tasks: image-text matching and image captioning, and demonstrate that neural scene graph generators can learn effective visual relation features to facilitate grounding language to visual relations and subsequently improve the two end applications. By combining relation features with the state-of-the-art models, our experiments show significant improvement on the standard Flickr30K and MSCOCO benchmarks. Our experimental results and analysis show that relation features improve downstream models' capability of capturing visual relations in end vision-and-language applications. We also demonstrate the importance of learning scene graph generators with visually relevant relations to the effectiveness of relation features.

研究动机与目标

  • 通过在视觉-语言模型中引入场景图关系特征,推动 grounding 语言到视觉关系的研究。
  • 证明关系感知特征在图像文本检索和描述任务上优于强基线。
  • 展示在语义丰富的关系数据集(VrR-VG)上训练场景图生成器的重要性,而非 VG150。
  • 开发一个用于图像文本匹配的关系感知变体 SCAN(R-SCAN),以及一个基于关系的自顶向下标题生成器。
  • 提供分析,证实通过 VrR-VG 学得的视觉相关关系在下游任务中带来显著收益。

提出的方法

  • 提出 R-SCAN,作为对 SCAN 的关系感知扩展,编码来自场景图生成器的区域(对象/物体)与视觉关系特征。
  • 使用软注意力机制将单词与区域特征和关系特征对齐,并通过一个视觉特征融合门自适应地为每个单词组合两者。
  • 使用门控融合的被关注区域和关系表示来计算单词-图像相似度。
  • 在一个小批量中的最难负样本上使用铰链三元组排序损失进行训练。
  • 通过将来自场景图的被关注关系特征与区域特征一同输入语言模型,扩展自顶向下的标题生成器。
  • 在 VrR-VG 上对 Stacked Motif Network 场景图生成器进行预训练(避免 Visual Genome VG150 偏差),以获得语义丰富的关系嵌入。
  • 可选地将 VG150 训练的关系特征与 VrR-VG 进行对比,并演示 VrR-VG 训练关系的优越性。

实验结果

研究问题

  • RQ1神经场景图学习的关系特征是否相较于仅区域的基线提升了图像文本匹配?
  • RQ2将关系特征整合到自顶向下的标题生成器中是否有助于图像描述?
  • RQ3在 VrR-VG 与 VG150 上进行场景图生成器的预训练会如何影响最终任务性能?
  • RQ4学习视觉相关的关系对将语言与视觉内容建立对齐在检索和描述任务中是否很关键?

主要发现

  • 结合 VrR-VG 关系特征的 R-SCAN 相较于 SCAN 基线,在 Flickr30K 与 MSCOCO 上提升了跨模态检索性能。
  • 在 Flickr30K 1K 测试集上,R-SCAN VrR-VG 的 text-to-image recall@1 为 40.1,text-to-image recall@5 为 70.5,text-to-image recall@10 为 81.8;image-to-text recall@1 为 39.6,image-to-text recall@5 为 72.7,image-to-text recall@10 为 83.7(相对于 SCAN t-i AVG 的 37.9、69.4、80.8 与 38.5、70.7、82.5)。
  • 在 MSCOCO 5K 测试集上,R-SCAN VrR-VG 的 text-to-image recall@1 为 57.6,text-to-image recall@5 为 87.3,text-to-image recall@10 为 93.7;image-to-text recall@1 为 70.3,image-to-text recall@5 为 94.5,image-to-text recall@10 为 98.1;而在一个对比设置中,SCAN t-i AVG 为 45.8、74.4、83.0 以及 61.8、87.5、93.7;Table 3 的变体给出 36.2、65.5、76.7 与 45.4、77.9、87.9。
  • 在 VrR-VG 上对关系特征进行预训练优于 VG150,在下游任务中带来更好的提升。
  • 基于关系的自顶向下标题生成在使用 VrR-VG 关系后,相较于基线自顶向下标题生成,在 CIDEr 与 SPICE 指标上均有提升(CIDEr:114.9→126.1,包含交叉熵与 CIDEr 优化; SPICE:20.9→21.8)。
  • 该方法未使用图卷积网络,而直接利用场景图派生的关系嵌入来实现语言对视觉的 grounding。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。