[论文解读] Towards Zero-shot Cross-lingual Image Retrieval
该论文提出了一种零样本跨语言图像检索框架,仅使用单语英语图文对进行训练,却能在推理时有效泛化至10种非英语语言。通过利用跨语言句子嵌入(mUSE 和 LASER)以及一种新型的 M3L 损失函数以增强文本聚类的分离度,该模型在零样本设置下表现优异,其在新提出的 XTD10 基准测试中的 Recall@1 达到英语 0.591 和德语 0.522,展示了无需多语言微调即可实现稳健的跨语言对齐能力。
There has been a recent spike in interest in multi-modal Language and Vision problems. On the language side, most of these models primarily focus on English since most multi-modal datasets are monolingual. We try to bridge this gap with a zero-shot approach for learning multi-modal representations using cross-lingual pre-training on the text side. We present a simple yet practical approach for building a cross-lingual image retrieval model which trains on a monolingual training dataset but can be used in a zero-shot cross-lingual fashion during inference. We also introduce a new objective function which tightens the text embedding clusters by pushing dissimilar texts from each other. Finally, we introduce a new 1K multi-lingual MSCOCO2014 caption test dataset (XTD10) in 7 languages that we collected using a crowdsourcing platform. We use this as the test set for evaluating zero-shot model performance across languages. XTD10 dataset is made publicly available here: https://github.com/adobe-research/Cross-lingual-Test-Dataset-XTD10
研究动机与目标
- 仅使用单语英语训练数据,实现零样本跨语言图像检索。
- 解决跨语言图像检索领域多语言评估数据集稀缺的问题。
- 通过一种新型损失函数,增强文本嵌入聚类的紧凑性,从而提升跨语言对齐能力。
- 在不进行多语言微调的前提下,评估模型在10种低资源非英语语言上的泛化能力。
提出的方法
- 使用度量学习在单语英语图文对上训练视觉-语言模型,将图像与文本映射到共享嵌入空间。
- 利用预训练的跨语言句子嵌入(mUSE 或 LASER)初始化文本编码器,以实现在多种语言下的零样本推理。
- 提出一种新型的 M3L 损失函数,将相似的图文对拉近,同时将不相似的文本相互推开,从而提升聚类紧凑性。
- 采用冻结的 ResNet-152 主干网络生成图像嵌入,以保持高效性与可迁移性。
- 采用共享权重的双编码器架构,使文本编码器在不同语言间共享,实现语言无关的表征学习。
- 使用新收集的 1K 多语言测试集(XTD10)评估性能,涵盖 7 种语言,其文本描述由众包平台人工标注。
实验结果
研究问题
- RQ1仅在单语英语数据上进行训练的模型,能否在多种语言上实现零样本跨语言图像检索?
- RQ2M3L 损失在提升文本嵌入聚类分离度与跨语言对齐能力方面的有效性如何?
- RQ3选择不同的跨语言句子编码器(mUSE 与 LASER)对零样本检索性能有何影响?
- RQ4该模型在多大程度上保持了非英语与英语文本嵌入之间的语义对齐?
- RQ5与多语言微调相比,零样本设置在召回率与泛化能力方面表现如何?
主要发现
- 仅使用英语训练数据,模型在英语测试集上的 Recall@1 达到 0.591,德语测试集上达到 0.522,展现出强大的零样本泛化能力。
- 采用 mUSE 的 M3L 损失在所有语言中均表现最优,尤其在非斯拉夫语系语言中优势显著。
- 基于 mUSE 的模型在非英语嵌入与对应英语嵌入之间表现出更紧密的聚类分布,解释了其更优的零样本性能。
- 即使基线模型 Portaz et al. (2019) 使用词级别跨语言嵌入,本模型在 Multi30K 数据集上的表现仍更优。
- 仅使用英语数据训练时,英语性能相比多语言训练略有下降,但降幅极小,且零样本设置在未见语言上泛化良好。
- 定性分析显示,即使排名第一的图像并非完美匹配,模型仍能捕捉到描述中的所有关键对象,表明其具备稳健的语义对齐能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。