Skip to main content
QUICK REVIEW

[论文解读] Graph Structured Network for Image-Text Matching

Chunxiao Liu, Zhendong Mao|arXiv (Cornell University)|Apr 1, 2020
Multimodal Machine Learning Applications参考文献 35被引用 8
一句话总结

本文提出了一种图结构匹配网络(GSMN),将图像和文本建模为异构图,其中节点代表对象、关系和属性,通过节点级和结构级匹配实现细粒度的短语级对应学习。GSMN在性能上达到当前最先进水平,在Flickr30K上的Recall@1提升了近7%,在MSCOCO上的提升约为2%,优于先前方法。

ABSTRACT

Image-text matching has received growing interest since it bridges vision and language. The key challenge lies in how to learn correspondence between image and text. Existing works learn coarse correspondence based on object co-occurrence statistics, while failing to learn fine-grained phrase correspondence. In this paper, we present a novel Graph Structured Matching Network (GSMN) to learn fine-grained correspondence. The GSMN explicitly models object, relation and attribute as a structured phrase, which not only allows to learn correspondence of object, relation and attribute separately, but also benefits to learn fine-grained correspondence of structured phrase. This is achieved by node-level matching and structure-level matching. The node-level matching associates each node with its relevant nodes from another modality, where the node can be object, relation or attribute. The associated nodes then jointly infer fine-grained correspondence by fusing neighborhood associations at structure-level matching. Comprehensive experiments show that GSMN outperforms state-of-the-art methods on benchmarks, with relative Recall@1 improvements of nearly 7% and 2% on Flickr30K and MSCOCO, respectively. Code will be released at: https://github.com/CrossmodalGroup/GSMN.

研究动机与目标

  • 为解决现有方法在学习图像与文本之间细粒度对应关系(尤其是关系和属性)方面的局限性。
  • 显式地将对象、关系和属性建模为结构化短语,以提高对齐精度。
  • 通过图卷积网络联合学习对象、关系和属性节点之间的对应关系。
  • 通过相互监督机制利用关系和属性上下文增强对象匹配。
  • 在标准图文匹配基准上超越现有最先进方法。

提出的方法

  • 构建视觉图和文本图,其中节点表示对象、关系和属性,边表示它们之间的相互作用。
  • 执行节点级匹配,基于相似度分数将一模态中的节点与另一模态中的相关节点关联。
  • 应用图卷积网络(GCNs)沿图边传播节点对应关系,实现结构级匹配。
  • 使用双向GRUs(Bi-GRUs)编码文本序列,捕捉长距离依赖,以更准确地估计文本图中的边权重。
  • 融合节点级和结构级对应关系,推断细粒度的短语级对齐,提升全局图文相似度预测性能。
  • 引入可学习的缩放因子λ,以平衡节点级匹配中的相关性,过滤无关的节点关联。

实验结果

研究问题

  • RQ1将图像和文本建模为结构化图是否能提升图文匹配中的细粒度对应学习?
  • RQ2联合学习对象、关系和属性对应关系如何提升对象匹配的准确性?
  • RQ3使用图卷积网络在图结构上传播节点级对应关系有何影响?
  • RQ4双向序列编码是否能提升文本图构建与匹配的质量?
  • RQ5超参数λ的选择如何影响节点级匹配性能及模型整体泛化能力?

主要发现

  • 与最先进方法相比,GSMN在Flickr30K基准上的Recall@1实现了近7%的相对提升。
  • 在MSCOCO基准上,GSMN相比现有SOTA方法将Recall@1提升了约2%。
  • 消融实验表明,采用双向匹配的完整GSMN优于仅使用单向匹配或无图结构的模型。
  • GCN深度为2的模型(GSMN-2GCN)性能低于基础模型,表明更深的传播可能引入来自间接连接节点的噪声。
  • 最优缩放因子λ因数据集而异——Flickr30K上λ=20,MSCOCO上λ=10,凸显了对数据分布的敏感性。
  • 可视化结果证实,GSMN学习到了细粒度的对应关系,能正确将关系(如“bite”)和属性(如“brown”、“gray”)与特定图像区域对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。