Skip to main content
QUICK REVIEW

[论文解读] Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking

Tan Wang, Xing Xu|arXiv (Cornell University)|Aug 12, 2019
Multimodal Machine Learning Applications参考文献 47被引用 10
一句话总结

本文提出 MTFN-RR,一种新颖的图像-文本匹配框架,通过多模态张量融合直接学习图像-文本相似度,无需共享嵌入空间,随后采用跨模态重排序方案以优化检索结果。该方法在 MSCOCO 和 Flickr30k 数据集上实现了最先进性能,且训练时间相比先前方法显著减少。

ABSTRACT

A major challenge in matching images and text is that they have intrinsically different data distributions and feature representations. Most existing approaches are based either on embedding or classification, the first one mapping image and text instances into a common embedding space for distance measuring, and the second one regarding image-text matching as a binary classification problem. Neither of these approaches can, however, balance the matching accuracy and model complexity well. We propose a novel framework that achieves remarkable matching performance with acceptable model complexity. Specifically, in the training stage, we propose a novel Multi-modal Tensor Fusion Network (MTFN) to explicitly learn an accurate image-text similarity function with rank-based tensor fusion rather than seeking a common embedding space for each image-text instance. Then, during testing, we deploy a generic Cross-modal Re-ranking (RR) scheme for refinement without requiring additional training procedure. Extensive experiments on two datasets demonstrate that our MTFN-RR consistently achieves the state-of-the-art matching performance with much less time complexity. The implementation code is available at https://github.com/Wangt-CN/MTFN-RR-PyTorch-Code.

研究动机与目标

  • 为解决图像与文本因数据分布和特征表示固有差异而导致的匹配挑战。
  • 克服现有基于嵌入和基于分类方法在匹配精度与模型复杂度之间平衡的局限性。
  • 通过结合张量融合与跨模态重排序,构建一种实现高性能且计算成本更低的框架。
  • 在无需为重排序额外训练的前提下,实现高效且有效的跨模态检索。

提出的方法

  • 多模态张量融合网络(MTFN)采用秩约束张量融合,直接从全局特征学习图像-文本相似度,避免对共享嵌入空间的依赖。
  • MTFN 采用两条分支——图像-文本融合与文本-文本融合——每条分支均应用张量融合,以建模模态间的丰富双线性交互。
  • 通过全连接层对融合向量预测相似度分数,并使用基于边距的排序损失进行优化,以增强正样本对与负样本对之间的分离度。
  • 在推理阶段应用一种通用的跨模态重排序(RR)方案,利用图像-文本与文本-文本相似度联合优化检索排序,无需重新训练。
  • 重排序过程使用 k-最近邻方法聚合跨模态关联,从而在 I2T 和 T2I 任务上均提升检索准确率。
  • 通过模型集成进一步提升性能,将多个 MTFN-RR 模型的输出进行平均,以增强鲁棒性与准确性。

实验结果

研究问题

  • RQ1能否设计一种框架,在保持低模型复杂度的同时实现高图像-文本匹配精度?
  • RQ2张量融合能否在不依赖共享嵌入空间的前提下,有效学习图像-文本相似度?
  • RQ3基于跨模态关联的后处理重排序策略是否能在不增加训练成本的情况下提升检索性能?
  • RQ4与 VSE++、SCAN 和 RRF-Net 等最先进方法相比,所提方法在效率与准确性方面表现如何?

主要发现

  • MTFN-RR 在 MSCOCO 与 Flickr30k 数据集上均达到最先进性能,Flickr30k 上 MTFN-RR (M=3) 的 I2T 任务 R@1 达 67.7,T2I 任务 R@1 达 53.2。
  • 该模型仅使用约 9 小时训练时间(基于全局特征)即达成此性能,显著快于先前方法如 sm-LSTM(50 小时)与 SCAN(60 小时)。
  • 跨模态重排序方案使 I2T 任务的 R@1 提升最高达 2.4 个百分点,T2I 任务提升最高达 1.2 个百分点,表明在各类方法中均具有一致增益。
  • 重排序性能在 K=6 个邻居时达到稳定,K 值更小时性能下降,表明存在最优邻域大小。
  • 模型集成进一步提升性能,MTFN-RR (M=3) 在 T2I 任务上优于最佳 SCAN 集成模型(R@1 53.2 vs. 48.6)。
  • 该方法具有良好的泛化能力,应用于其他最先进模型(如 DAN、VSE++、SCAN)时,亦表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。