Skip to main content
QUICK REVIEW

[论文解读] MURAL: Multimodal, Multitask Retrieval Across Languages

Aashi Jain, Mandy Guo|arXiv (Cornell University)|Sep 10, 2021
Multimodal Machine Learning Applications参考文献 43被引用 13
一句话总结

MURAL 提出了一种双编码器模型,通过在 18 亿张图像-标题对和 60 亿翻译对上使用对比学习,联合学习多模态(图像-文本)和多语言(文本-文本)表征。该模型在零样本和微调设置下的跨模态检索性能达到当前最先进水平,尤其在低资源语言上表现优异,在 Wikipedia 图像-文本数据集上,相较于 ALIGN 模型,平均提升了 8.1% 的平均召回率。

ABSTRACT

Both image-caption pairs and translation pairs provide the means to learn deep representations of and connections between languages. We use both types of pairs in MURAL (MUltimodal, MUltitask Representations Across Languages), a dual encoder that solves two tasks: 1) image-text matching and 2) translation pair matching. By incorporating billions of translation pairs, MURAL extends ALIGN (Jia et al. PMLR'21)--a state-of-the-art dual encoder learned from 1.8 billion noisy image-text pairs. When using the same encoders, MURAL's performance matches or exceeds ALIGN's cross-modal retrieval performance on well-resourced languages across several datasets. More importantly, it considerably improves performance on under-resourced languages, showing that text-text learning can overcome a paucity of image-caption examples for these languages. On the Wikipedia Image-Text dataset, for example, MURAL-base improves zero-shot mean recall by 8.1% on average for eight under-resourced languages and by 6.8% on average when fine-tuning. We additionally show that MURAL's text representations cluster not only with respect to genealogical connections but also based on areal linguistics, such as the Balkan Sprachbund.

研究动机与目标

  • 提升低资源语言的跨模态检索性能,这些语言因图像-标题训练数据有限而面临挑战。
  • 探究在图像-标题数据稀缺的情况下,利用大规模多语言翻译对进行学习是否能增强多模态表征学习。
  • 评估在图像-文本对和文本-文本对上联合使用多任务对比学习训练的双编码器模型,是否能超越复杂的交叉编码器基线模型。
  • 分析所学习的多语言表征是否反映了超越语系关系的语际关系,例如巴尔干语言联盟(如巴尔干语系)。

提出的方法

  • 使用对比学习在两个任务上训练双编码器模型:图像-文本匹配和文本-文本(翻译对)匹配。
  • 利用来自 Alt-Text 数据集的 18 亿条噪声图像-标题对和来自基于 Common Crawl 的 bitext 数据集的 60 亿条翻译对。
  • 采用批内负样本采样与对比损失,对齐跨模态和跨语言的图像与文本嵌入。
  • 在 Wikipedia 图像-文本(WIT)数据集上微调模型,以提升零样本和少样本泛化能力。
  • 应用近似最近邻(ANN)搜索以实现高效的检索推理。
  • 可视化文本嵌入,分析基于语言关系和地理邻近性的聚类模式。

实验结果

研究问题

  • RQ1当图像-标题数据有限时,从大规模多语言翻译对中学习是否能提升低资源语言的跨模态检索性能?
  • RQ2与单任务模型相比,同时在图像-文本和文本-文本匹配上进行多任务训练,是否能提升零样本和微调后的检索性能?
  • RQ3MURAL 中学习到的多语言表征是否反映了语系分类之外的地域性语言关系,例如巴尔干语言联盟?
  • RQ4在保持可扩展性的前提下,简单的双编码器架构是否能超越更复杂的交叉编码器模型?
  • RQ5预训练数据中包含高资源枢纽语言在多大程度上提升了模型性能?

主要发现

  • 在 Wikipedia 图像-文本(WIT)数据集上,MURAL 相较于 ALIGN 模型,平均提升了 8.1% 的零样本平均召回率(针对八种低资源语言),微调后提升 6.8%。
  • 在 XTD 基准测试中,MURAL 在多语言图像-文本检索任务上,平均召回率@10 相较于 ALIGN 提升 4%。
  • 在 Multi30k 数据集上,MURAL-large 在四种语言的零样本检索中,平均召回率相较 M3P 提升 47.7%,相较 UC2 提升 5.9%。
  • 在 WIT 数据集的零样本检索中,MURAL-large 相较于强基线模型(翻译-测试)在高资源语言上提升 13.2% 的平均召回率,在低资源语言上提升 9.6%。
  • 在 CxC 基准测试中,MURAL-large 在文本→文本和图像→图像检索任务上达到迄今最高得分,并在语义图像相似度任务上与最佳模型并列。
  • 文本嵌入可视化显示,语言不仅按语系关系聚类,也按地域语言接触关系聚类,例如匈牙利语与捷克语的地理邻近性,表明多模态学习能够捕捉基于接触的语言模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。