Skip to main content
QUICK REVIEW

[论文解读] Revisiting Cross Modal Retrieval

Shah Nawaz, Muhammad Kamran Janjua|arXiv (Cornell University)|Jul 19, 2018
Multimodal Machine Learning Applications参考文献 57被引用 4
一句话总结

本文提出了一种单网络跨模态检索系统,通过将图像和文本编码融合到共享嵌入空间中,消除了对每种模态单独网络的需求。通过利用InceptionResNet-V1结合中心损失进行联合训练,该方法在MS-COCO和Flickr30K数据集上取得了具有竞争力的性能,表明通过统一的文本编码可以有效捕捉模态之间的语义关系,从而挑战了多网络架构的主导地位。

ABSTRACT

This paper proposes a cross-modal retrieval system that leverages on image and text encoding. Most multimodal architectures employ separate networks for each modality to capture the semantic relationship between them. However, in our work image-text encoding can achieve comparable results in terms of cross-modal retrieval without having to use a separate network for each modality. We show that text encodings can capture semantic relationships between multiple modalities. In our knowledge, this work is the first of its kind in terms of employing a single network and fused image-text embedding for cross-modal retrieval. We evaluate our approach on two famous multimodal datasets: MS-COCO and Flickr30K.

研究动机与目标

  • 开发一种统一的深度学习架构用于跨模态检索,避免为图像和文本分别使用独立网络。
  • 评估仅使用文本编码是否能够捕捉模态间的语义关系,从而减少对配对图像-文本数据的依赖。
  • 质疑Recall@K作为多模态检索系统主要评估指标的有效性。
  • 证明单一、可扩展的网络能够有效将图像和文本映射到共享嵌入空间。

提出的方法

  • 使用单一InceptionResNet-V1主干网络处理图像和文本编码输入,共享同一网络架构。
  • 通过预训练的句子嵌入实现文本编码,以在联合空间中表示文本描述。
  • 应用中心损失作为监督信号,以最小化图像-文本配对之间的类内距离。
  • 在网络早期阶段融合图像和文本表征,以实现语义关系的联合学习。
  • 采用对比损失进行端到端训练,以增强匹配图像-文本对之间的语义相似性。
  • 通过共享嵌入空间中的欧氏距离执行检索,基于最近邻排序进行评估。

实验结果

研究问题

  • RQ1单个网络是否能够在不为每种模态分别使用编码器的情况下,有效学习联合的图像-文本表征?
  • RQ2仅使用文本编码在多大程度上能够捕捉图像与其描述之间的语义关系?
  • RQ3统一网络的性能与标准基准测试中多网络SOTA方法相比如何?
  • RQ4Recall@K为何无法准确反映检索结果的语义相似性?何种替代评估标准更为合适?

主要发现

  • 所提出的单网络方法在MS-COCO上实现了45.76的Recall@10得分,在Flickr30K上实现了42.6的Recall@10得分,用于句子到图像的检索,尽管采用了统一架构,但仍表现出竞争力。
  • 在MS-COCO上,图像到句子检索的Recall@5达到30.10,在Flickr30K上达到33.0,表明跨模态对齐具有鲁棒性。
  • 作者认为Recall@K是评估语义检索的不良指标,因为它未能考虑语义相似但未配对的样本,如图1所示。
  • 结果表明,即使检索结果在语义上合理,若未检索到确切的配对样本,Recall@K得分仍可能偏低,凸显了该指标的关键局限性。
  • 本研究证明,仅使用文本编码即可有效捕捉跨模态语义关系,因此无需使用专门的模态特定网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。