[论文解读] AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities
该论文提出AltCLIP,一种两阶段方法,通过将CLIP的文本编码器替换为XLM-R,并结合知识蒸馏与对比学习,在有限的图文对数据上,将CLIP的能力扩展至中英文双语及多语言多模态表征学习。该方法在中文零样本图像分类与检索基准上实现了最先进性能,且数据与计算成本极低,同时在英文任务上仍保持优异表现。
In this work, we present a conceptually simple and effective method to train a strong bilingual/multilingual multimodal representation model. Starting from the pre-trained multimodal representation model CLIP released by OpenAI, we altered its text encoder with a pre-trained multilingual text encoder XLM-R, and aligned both languages and image representations by a two-stage training schema consisting of teacher learning and contrastive learning. We validate our method through evaluations of a wide range of tasks. We set new state-of-the-art performances on a bunch of tasks including ImageNet-CN, Flicker30k-CN, COCO-CN and XTD. Further, we obtain very close performances with CLIP on almost all tasks, suggesting that one can simply alter the text encoder in CLIP for extended capabilities such as multilingual understanding. Our models and code are available at https://github.com/FlagAI-Open/FlagAI.
研究动机与目标
- 在无需大规模多语言图文对数据的前提下,将CLIP的零样本泛化能力扩展至多语言及双语场景。
- 提升视觉-语言任务中的跨语言迁移性能,尤其在中文等非英语低资源语言场景下。
- 在增加对中文及其他语言支持的同时,保持在英文基准上的强性能。
- 探究将知识蒸馏与对比微调结合用于多语言多模态预训练的有效性。
- 探究高质量人工标注翻译是否能提升低资源语言中的零样本性能。
提出的方法
- 将CLIP原始文本编码器替换为XLM-R,一种在多种语言上预训练的多语言语言模型。
- 采用两阶段训练框架:第一阶段,利用单语及平行语言数据(包括英英与英汉配对)从CLIP的文本编码器向新XLM-R编码器进行知识蒸馏。
- 第二阶段,通过在少量精选的英汉图文对上进行对比学习微调,对齐视觉与语言表征。
- 在蒸馏阶段同时使用机器翻译与人工校对的平行数据,以提升表征质量。
- 将相同的两阶段方法应用于训练多语言版本AltCLIP M9,支持九种语言。
- 使用AltCLIP的文本编码器微调文本到图像扩散模型(Stable Diffusion),以评估生成任务中的跨语言对齐效果。
实验结果
研究问题
- RQ1从CLIP的文本编码器向XLM-R等多语言编码器进行知识蒸馏,能否有效将视觉-语言理解能力迁移至中文等低资源语言?
- RQ2在蒸馏阶段同时使用机器翻译与人工校对的平行数据,是否能显著提升中文基准上的零样本性能?
- RQ3两阶段训练(蒸馏 + 对比微调)在多语言检索与图像分类任务上的性能提升程度如何?
- RQ4仅使用数千万文本标记与200万图文对训练的模型,能否在中文视觉-语言任务上实现SOTA性能,超越使用数亿对数据训练的模型?
- RQ5当使用多语言文本编码器(如AltCLIP M9)进行图像生成时,多语言提示中的文化差异如何影响生成结果?
主要发现
- AltCLIP在ImageNet-CN、Flicker30k-CN、COCO-CN与XTD基准上实现了零样本SOTA性能,尽管仅使用200万图文对与数千万文本标记,仍优于先前方法。
- 模型在ImageNet上的零样本准确率达到53.8%,与CLIP的55.7%非常接近,表明在多语言适配后仍能有效保留英文能力。
- 若在蒸馏阶段排除英英平行数据,ImageNet-English准确率将降至15.47%,凸显其在保持跨语言对齐方面的重要性。
- 在蒸馏阶段引入人工校对的翻译数据,显著提升了ImageNet-CN的准确率,表明数据质量与多样性可增强表征学习。
- 使用AltCLIP文本编码器微调的扩散模型AltDiffusion,能从英文与中文提示生成高质量图像,且对翻译提示的输出相似,表明实现了有效的跨语言对齐。
- AltCLIP M9在多语言XTD基准上实现了零样本SOTA结果,证明其在九种语言间具有强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。