[论文解读] Towards Zero-shot Cross-lingual Image Retrieval and Tagging
本文提出了一种零样本跨语言图像检索与标注框架,利用单语种训练数据和跨语言句子嵌入,实现无需并行训练数据的多语言检索与标注。该方法引入一种新型度量学习目标,以收紧文本嵌入聚类,并在新创建的1000个样本多语言测试集(XTD10)上评估性能,涵盖七种语言,显示出在德语和法语等语言上的强大零样本泛化能力。
There has been a recent spike in interest in multi-modal Language and Vision problems. On the language side, most of these models primarily focus on English since most multi-modal datasets are monolingual. We try to bridge this gap with a zero-shot approach for learning multi-modal representations using cross-lingual pre-training on the text side. We present a simple yet practical approach for building a cross-lingual image retrieval model which trains on a monolingual training dataset but can be used in a zero-shot cross-lingual fashion during inference. We also introduce a new objective function which tightens the text embedding clusters by pushing dissimilar texts away from each other. For evaluation, we introduce a new 1K multi-lingual MSCOCO2014 caption test dataset (XTD10) in 7 languages that we collected using a crowdsourcing platform. We use this as the test set for zero-shot model performance across languages. We also demonstrate how a cross-lingual model can be used for downstream tasks like multi-lingual image tagging in a zero shot manner. XTD10 dataset is made publicly available here: https://github.com/adobe-research/Cross-lingual-Test-Dataset-XTD10.
研究动机与目标
- 仅使用单语种训练数据和预训练的跨语言嵌入,实现零样本跨语言图像检索。
- 通过创建一个包含七种语言的1000个样本多语言测试集(XTD10),解决跨语言图像检索缺乏多语言评估基准的问题。
- 通过引入一种新颖的度量学习目标,提升文本嵌入聚类效果,使不同类别的文本彼此分离。
- 展示跨语言模型在下游任务(如零样本多语言图像标注)中的适用性。
- 通过捕捉跨语言的图文上下文,克服图像标注中词级翻译的局限性。
提出的方法
- 在单语种MSCOCO2014数据上微调视觉-语言模型,使用跨语言句子编码器(如mUSE)实现跨语言的图像与文本嵌入对齐。
- 提出一种新型度量学习目标,最小化匹配图像-文本对的类内距离,同时最大化不匹配对在不同语言间的类间距离。
- 使用mUSE(多语言通用句子编码器)进行跨语言文本编码,实现训练中未见过语言的零样本推理。
- 通过众包构建XTD10数据集,包含来自MSCOCO2014的1000张图像及其在10种非英语语言中的描述,用于零样本评估。
- 通过利用预训练的英语图像标签模型和跨语言对齐,将相同模型架构应用于多语言图像标注任务,实现目标语言的零样本推理。
- 使用召回率@1(R@1)和R@5在XTD10上评估性能,并与基线模型及基于谷歌翻译的词级翻译方法进行比较。
实验结果
研究问题
- RQ1在仅使用单语种图像-文本对进行训练的模型,能否在多种低资源语言上实现零样本跨语言图像检索?
- RQ2所提出的度量学习目标在提升跨语言文本嵌入聚类效果方面有多有效?
- RQ3相同的跨语言表征能否有效用于零样本多语言图像标注,且优于词级翻译方法?
- RQ4该零样本模型在不同语言上的性能与多语言微调基线相比如何?
- RQ5该模型在多语言词义歧义(如'spring'作为季节或物体)上的消歧能力如何?
主要发现
- 所提模型在XTD10基准上实现优异的零样本性能,法语R@1得分为58.5%,德语为57.0%,优于基线模型。
- 模型显著改善了跨语言文本嵌入的聚类效果,mUSE生成的嵌入聚类比LASER更紧密,从而实现更优的跨语言对齐。
- 在零样本图像标注任务中,模型能正确识别上下文相关的翻译(如'spring'作为季节或物体),而谷歌翻译在'spring'、'bank'和'turkey'等歧义词上出现失败。
- 模型在低资源语言上泛化良好,德语和法语性能仅比多语言训练略有下降,表明其具备强大的零样本泛化能力。
- 新型度量学习目标有效减少了类间混淆,表现为更紧密的文本嵌入聚类以及在各类语言中检索准确率的提升。
- XTD10数据集支持零样本跨语言图像检索的标准化评估,并已公开发布,以支持未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。