[论文解读] UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training
UC2 提出了一种新颖的机器翻译增强型框架,用于通用跨语言跨模态视觉-语言预训练,利用图像作为共享枢纽,将多语言图像字幕与视觉特征对齐。通过引入两项新的预训练任务——掩码区域到标记建模(Masked Region-to-Token Modeling)和视觉翻译语言建模(Visual Translation Language Modeling),UC2 在多语言图像-文本检索和视觉问答(VQA)基准上实现了最先进性能,同时保持了强大的英语性能。
Vision-and-language pre-training has achieved impressive success in learning multimodal representations between vision and language. To generalize this success to non-English languages, we introduce UC2, the first machine translation-augmented framework for cross-lingual cross-modal representation learning. To tackle the scarcity problem of multilingual captions for image datasets, we first augment existing English-only datasets with other languages via machine translation (MT). Then we extend the standard Masked Language Modeling and Image-Text Matching training objectives to multilingual setting, where alignment between different languages is captured through shared visual context (i.e, using image as pivot). To facilitate the learning of a joint embedding space of images and all languages of interest, we further propose two novel pre-training tasks, namely Masked Region-to-Token Modeling (MRTM) and Visual Translation Language Modeling (VTLM), leveraging MT-enhanced translated data. Evaluation on multilingual image-text retrieval and multilingual visual question answering benchmarks demonstrates that our proposed framework achieves new state-of-the-art on diverse non-English benchmarks while maintaining comparable performance to monolingual pre-trained models on English tasks.
研究动机与目标
- 通过使用机器翻译增强仅含英语的图像字幕数据集,解决多语言图像字幕数据集稀缺的问题。
- 通过在多种语言间实现联合表示学习,克服现有视觉-语言模型主要服务于英语所带来的语言偏见。
- 开发一个统一的预训练框架,利用图像作为共享枢纽,对齐视觉与多种语言,减少对单语模型的依赖。
- 通过针对多语言多模态理解量身定制的新预训练目标,提升跨语言与跨模态对齐能力。
- 在非英语基准上实现强大的零样本或少样本迁移性能,而无需进行语言特定的微调。
提出的方法
- 利用神经机器翻译(MT)将现有仅含英语的图像-字幕数据集扩展为多语言字幕,构建大规模多语言训练语料库。
- 通过将共享图像作为跨语言对齐的枢纽,将标准预训练任务(掩码语言建模和图文匹配)扩展到多语言设置。
- 提出掩码区域到标记建模(MRTM),在共享嵌入空间中将词标记与图像检测器预测的区域标签(区域标签)对齐,以增强局部跨模态对齐。
- 引入视觉翻译语言建模(VTLM),通过利用并行翻译的字幕及其对应图像,联合学习跨语言与跨模态表示。
- 训练一个可同时关注图像和所有语言变体的跨语言跨模态 Transformer,实现联合嵌入空间学习。
- 采用两阶段预训练策略:首先在多语言图像-字幕对上进行预训练,然后使用语言特定数据在下游任务上进行微调。
实验结果
研究问题
- RQ1机器翻译能否有效增强现有的仅含英语的图像-字幕数据集,从而支持多语言视觉-语言模型的训练?
- RQ2与以英语为枢纽相比,以图像为枢纽是否能提升视觉-语言任务中的跨语言迁移性能?
- RQ3像 MRTM 和 VTLM 这类新型预训练目标能否增强语言标记、图像区域与多语言语义之间的细粒度对齐?
- RQ4所提出的 UC2 框架在英语基准上的表现与单语模型相比如何?在非英语任务上与多语言基线相比表现如何?
- RQ5该模型在低资源语言的检索和视觉问答任务中泛化能力如何?
主要发现
- UC2 在四个语言(英语、德语、法语、捷克语)的多语言图像-文本检索任务中达到最先进性能,在 Flickr30K 和 MSCOCO 基准上的元平均准确率达到 85.3%。
- 在 VQA v2.0 基准上,UC2 达到 71.48% 的测试开发集准确率,优于先前方法,展现出强大的零样本跨语言迁移能力。
- 消融实验表明,移除 MRTM 会使 VQA 性能下降 0.55 分,表明其在细粒度视觉-语言对齐中的关键作用。
- VTLM 对检索性能有显著贡献,当与 MRTM 结合时,元平均准确率提升 0.9 分。
- 在多语言检索任务中,图像枢纽策略平均优于英语枢纽策略 1.1 分,尤其显著提升了低资源语言的表现。
- 可视化结果证实,不同语言中语义等价的词语(如英语、德语、捷克语)会关注同一图像区域,验证了跨语言对齐的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。