Skip to main content
QUICK REVIEW

[论文解读] Multilingual Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer of Vision-Language Models

Po-Yao Huang, Mandela Patrick|arXiv (Cornell University)|Mar 16, 2021
Multimodal Machine Learning Applications参考文献 68被引用 5
一句话总结

本文提出一种多语言多模态预训练(MMP)策略,利用新型多语言视频数据集 Multi-HowTo100M,以提升视觉-语言模型中的零样本跨语言迁移性能。通过基于 Transformer 的模型联合预训练多语言文本与视频数据,该方法在多语言文本到视频及文本到图像搜索任务中达到最先进性能,在零样本设置下,九种语言的平均 R@1 提升了 2–2.5 个百分点。

ABSTRACT

This paper studies zero-shot cross-lingual transfer of vision-language models. Specifically, we focus on multilingual text-to-video search and propose a Transformer-based model that learns contextualized multilingual multimodal embeddings. Under a zero-shot setting, we empirically demonstrate that performance degrades significantly when we query the multilingual text-video model with non-English sentences. To address this problem, we introduce a multilingual multimodal pre-training strategy, and collect a new multilingual instructional video dataset (MultiHowTo100M) for pre-training. Experiments on VTT show that our method significantly improves video search in non-English languages without additional annotations. Furthermore, when multilingual annotations are available, our method outperforms recent baselines by a large margin in multilingual text-to-video search on VTT and VATEX; as well as in multilingual text-to-image search on Multi30K. Our model and Multi-HowTo100M is available at http://github.com/berniebear/Multi-HT100M.

研究动机与目标

  • 解决视觉-语言模型在非英语语言查询时零样本跨语言迁移能力有限的问题。
  • 克服仅在英语数据上预训练的模型在非英语文本到视频搜索中性能下降的问题。
  • 开发一种可扩展的多语言多模态预训练策略,利用视觉数据作为通用语义枢纽,对齐跨语言表征。
  • 构建一个大规模多语言教学视频数据集(Multi-HowTo100M),包含九种语言的字幕,以支持有效预训练。
  • 证明跨语言的视觉-文本对齐可提升零样本跨语言迁移的泛化能力,即使没有领域内非英语标注。

提出的方法

  • 提出一种基于 Transformer 的视频-文本模型,从配对的文本与视频输入中学习上下文相关的多语言多模态嵌入。
  • 设计一种多语言多模态预训练(MMP)目标,联合优化多种语言下多语言文本与视觉特征之间的交叉注意力。
  • 通过在 HowTo100M 数据集基础上增加九种语言的字幕,构建 Multi-HowTo100M 数据集,总计 120 万条教学视频。
  • 使用对比学习目标在多语言视频-文本数据上预训练模型,以对齐跨语言的文本与视觉表征。
  • 在下游多语言文本到视频及文本到图像检索任务中,仅使用英语标注在零样本设置下微调模型。
  • 应用一个学习率加倍的线性投影头,将 2D-CNN 特征(用于图像)与 3D-CNN 特征(用于视频)对齐,实现跨模态迁移。

实验结果

研究问题

  • RQ1为何视觉-语言模型在非英语语言查询时,尽管在英语上表现良好,仍会出现显著的零样本跨语言迁移性能下降?
  • RQ2通过利用视觉数据作为共享语义枢纽,是否能在多语言文本-视频数据上预训练,从而提升视觉-语言模型的零样本跨语言迁移性能?
  • RQ3与仅在英语数据上预训练的模型相比,多语言多模态预训练在多语言文本到视频及文本到图像检索任务中的性能提升程度如何?
  • RQ4当在无额外标注的情况下跨模态(如从视频到图像)迁移时,所提方法的有效性如何?
  • RQ5该模型能否在无领域内标注的情况下泛化到低资源语言(如捷克语),并与使用多语言数据的基线方法进行比较?

主要发现

  • 所提出的多语言多模态预训练(MMP)策略在 VTT 数据集上,使九种语言的平均 R@1 提升了 2–2.5 个百分点,显著改善了零样本跨语言迁移性能。
  • 在 VATEX 数据集上,当使用多语言标注时,该模型在多语言文本到视频搜索任务中大幅超越近期基线模型。
  • 在 Multi30K 数据集上的多语言文本到图像搜索任务中,采用 MMP 的模型达到最先进性能,即使仅使用英语标注,也优于 MHA-D 和 SMALR 等基线模型。
  • 在仅使用英语标注的情况下,从视频模态迁移到图像模态时,该模型在 Multi30K 上的平均 R@1 提升了 3.2 个百分点,且在低资源语言(如捷克语)中提升更大。
  • 即使没有任何捷克语标注,采用 MMP 的零样本模型性能仍可与使用 10 种语言(包括捷克语)的 SMALR 模型相媲美,证明了强大的零样本泛化能力。
  • 该方法显著缩小了英语与非英语查询之间的性能差距,表明视觉数据可作为多模态表征中跨语言对齐的通用枢纽。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。