Skip to main content
QUICK REVIEW

[论文解读] Image search using multilingual texts: a cross-modal learning approach between image and text

Maxime Portaz, Hicham Randrianarivo|arXiv (Cornell University)|Mar 27, 2019
Multimodal Machine Learning Applications参考文献 32被引用 10
一句话总结

该论文提出了一种跨模态学习框架,通过使用卷积神经网络(CNN)处理图像,以及使用循环神经网络(RNN)结合多语言词嵌入(BIVEC 或 MUSE)处理多语言文本,将图像和多语言文本联合嵌入到共享向量空间中。该方法在多语言图像检索任务中取得了最先进性能,在使用 BIVEC 的 Multi30K 数据集上实现了 recall@10 提升 15.15%,在使用 MUSE 的四国语言多语言检索任务中达到 49.38% 的 recall@10。

ABSTRACT

Multilingual (or cross-lingual) embeddings represent several languages in a unique vector space. Using a common embedding space enables for a shared semantic between words from different languages. In this paper, we propose to embed images and texts into a unique distributional vector space, enabling to search images by using text queries expressing information needs related to the (visual) content of images, as well as using image similarity. Our framework forces the representation of an image to be similar to the representation of the text that describes it. Moreover, by using multilingual embeddings we ensure that words from two different languages have close descriptors and thus are attached to similar images. We provide experimental evidence of the efficiency of our approach by experimenting it on two datasets: Common Objects in COntext (COCO) [19] and Multi30K [7].

研究动机与目标

  • 通过在共享向量空间中对齐图像和文本表示,实现使用多语言文本查询进行图像搜索。
  • 通过利用多语言训练数据提升图像检索性能,即使目标语言在训练期间未出现过。
  • 评估两种多语言嵌入方法——BIVEC 和 MUSE——在跨模态检索任务中的有效性。
  • 证明在额外语言上进行训练可提升所有语言(包括英语)的检索性能。
  • 通过使用对齐的多语言嵌入,实现零样本多语言图像检索。

提出的方法

  • 该框架使用卷积神经网络(CNN)从图像中提取视觉特征,并将其投影到共享嵌入空间。
  • 文本表示通过循环神经网络(RNN)生成,该网络处理使用多语言词嵌入编码的句子。
  • 多语言嵌入可通过 BIVEC 学习,即通过双语句子对联合训练两种语言;或通过 MUSE 学习,即学习独立训练的单语嵌入之间的映射。
  • 模型通过最小化同一样本的图像和文本嵌入之间的对比损失进行训练,使它们在共享空间中彼此接近。
  • 该方法支持零样本检索:由于共享的多语言空间,即使在训练期间未见过的语言,也能使用其查询检索图像。
  • 该框架支持双向检索:可在多种语言中实现从文本查询检索图像,以及从图像查询检索文本。

实验结果

研究问题

  • RQ1是否能够通过单一模型将图像和多语言文本联合嵌入到共享向量空间中,以实现跨语言图像检索?
  • RQ2在额外语言上进行训练是否能提升已见语言和未见语言的图像检索性能?
  • RQ3在多语言图像检索中,BIVEC 和 MUSE 嵌入在性能和零样本泛化能力方面如何比较?
  • RQ4是否可以利用多语言数据在不损害其性能的前提下提升英语图像检索性能?
  • RQ5在训练期间添加新语言对多种语言的召回率性能有何影响?

主要发现

  • 使用 BIVEC 嵌入,与单语基线相比,该方法在 COCO 数据集上的 recall@10 提升了 3.35% 的绝对值。
  • 在 Multi30K 数据集上,基于 BIVEC 的方法相比基线实现了 recall@10 提升 15.15%,表明其具有强大的多语言泛化能力。
  • 当在英语和法语上进行训练时,BIVEC 模型在法语上的 recall@10 达到 55.22%,比基于 MUSE 的模型高出 26.39%。
  • 基于 MUSE 的模型在包含四种语言(英语、法语、德语、捷克语)的多语言检索任务中实现了 49.38% 的 recall@10,表现出强大的零样本性能。
  • 在训练期间添加新语言会导致英语性能下降(recall@1 最多下降 2.62%),但多语言召回率显著提升,当包含全部四种语言时,recall@10 提升了 6.42%。
  • 该模型表明,在新语言上进行训练不仅提升了该语言的性能,也提升了其他语言(包括英语)的性能,表明语言之间存在正向迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。