[论文解读] Generalizing Multimodal Pre-training into Multilingual via Language Acquisition
本文提出多语言获取(MLA),一种轻量级框架,可将单语视觉-语言预训练(VLP)模型(如CLIP)高效泛化为多语言系统,计算成本极低且可扩展性强。通过采用两阶段训练策略——母语迁移与语言暴露——MLA 实现了高效、可扩展的多语言适配,且不会降低源语言性能,在多语言图文与视频-文本检索任务中达到最先进水平,且所需数据与资源显著减少。
English-based Vision-Language Pre-training (VLP) has achieved great success in various downstream tasks. Some efforts have been taken to generalize this success to non-English languages through Multilingual Vision-Language Pre-training (M-VLP). However, due to the large number of languages, M-VLP models often require huge computing resources and cannot be flexibly extended to new languages. In this work, we propose a extbf{M}ulti extbf{L}ingual extbf{A}cquisition (MLA) framework that can easily generalize a monolingual Vision-Language Pre-training model into multilingual. Specifically, we design a lightweight language acquisition encoder based on state-of-the-art monolingual VLP models. We further propose a two-stage training strategy to optimize the language acquisition encoder, namely the Native Language Transfer stage and the Language Exposure stage. With much less multilingual training data and computing resources, our model achieves state-of-the-art performance on multilingual image-text and video-text retrieval benchmarks.
研究动机与目标
- 解决现有多语言视觉-语言预训练(M-VLP)模型计算成本高、可扩展性差的问题,这些模型需要海量数据和重新训练才能支持新语言。
- 实现对单语 VLP 模型的高效、灵活且无性能下降的扩展,以支持新语言,而无需重新训练基础模型。
- 开发一种数据高效的方法,在已见语言和未见语言上均保持强性能,尤其在低资源环境下表现优异。
- 通过先将新语言与母语对齐,再将其暴露于多模态数据中,模拟人类语言学习过程。
- 证明解耦的语言获取器可实现独立的语言适配,而不会对原始语言性能造成下降。
提出的方法
- 引入一个轻量级语言获取编码器,由语言获取器和非母语嵌入组成,插入预训练的单语 VLP 模型(如 CLIP)中。
- 固定原始单语编码器参数,仅对新语言的语音获取器和非母语嵌入进行微调。
- 实施两阶段训练策略:(1) 母语迁移(NLT),通过对比学习将新语言标记与母语对齐;(2) 语言暴露(LE),将新语言表征与视觉特征对齐。
- 在两个阶段均使用图文对比学习目标,以优化新语言中的跨模态对齐。
- 仅使用全量 M-VLP 模型所需多语言数据的一小部分来训练语言获取器,显著降低资源需求。
- 将语言相关组件解耦,使新语言可独立添加,无需重新训练整个模型。
实验结果
研究问题
- RQ1单语 VLP 模型能否在仅使用少量附加训练数据和计算成本的情况下,有效泛化到多种语言?
- RQ2受人类语言习得启发的两阶段训练策略是否能提升多语言性能,同时保持对源语言的性能?
- RQ3所提出的框架能否在不降低已有支持语言性能的前提下支持新语言?
- RQ4在仅提供有限图文对的新语言低资源设置下,模型表现如何?
- RQ5与现有 M-VLP 方法相比,该框架是否更具数据效率,尤其是在扩展至大量语言时?
主要发现
- MLA CLIP 在多语言图文检索任务中达到最先进性能,显著优于先前的 SOTA 模型(如 UC 2 和 MURAL),且训练数据与计算资源更少。
- 在 XTD 基准测试中,MLA CLIP 在已见语言(如英语的平均召回率达 75.9%)上保持强劲性能,即使在微调未见语言后仍表现稳定,而 UC 2 则出现严重性能下降。
- 当每种语言仅使用 30K 组图文对进行训练时,MLA 的性能仍优于 UC 2(后者每种语言预训练使用了 300 万组图文对),证明其卓越的数据效率。
- 在仅提供 600 组文本-文本对的韩语低资源设置下,MLA CLIP 达到 78.7% 的检索准确率,随着添加图文对进一步提升至 80.1%。
- 消融实验表明,训练策略的两个阶段均至关重要:若移除 NLT 阶段,平均性能下降超过 10 个百分点;若移除 LE 阶段,则跨模态对齐效果极差。
- 解耦的语言获取器可实现无缝扩展至新语言,无需重新训练基础模型,从而支持可扩展的多语言多模态系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。