[论文解读] MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting
MAPL 是一种参数高效的参数化方法,通过在表示空间之间学习轻量级映射,将冻结的单模态视觉和语言模型适配于视觉-语言少样本提示任务。它在 VQA 和图像字幕生成基准测试中实现了具有竞争力的性能,同时训练的参数量相比之前的方法少几个数量级,即使在低数据和领域内设置下也表现优异。
Large pre-trained models have proved to be remarkable zero- and (prompt-based) few-shot learners in unimodal vision and language tasks. We propose MAPL, a simple and parameter-efficient method that reuses frozen pre-trained unimodal models and leverages their strong generalization capabilities in multimodal vision-language (VL) settings. MAPL learns a lightweight mapping between the representation spaces of unimodal models using aligned image-text data, and can generalize to unseen VL tasks from just a few in-context examples. The small number of trainable parameters makes MAPL effective at low-data and in-domain learning. Moreover, MAPL's modularity enables easy extension to other pre-trained models. Extensive experiments on several visual question answering and image captioning benchmarks show that MAPL achieves superior or competitive performance compared to similar methods while training orders of magnitude fewer parameters. MAPL can be trained in just a few hours using modest computational resources and public datasets. We release our code and pre-trained model weights at https://github.com/mair-lab/mapl.
研究动机与目标
- 通过仅使用少量上下文示例,实现在视觉-语言任务中的少样本泛化。
- 与现有微调或在大型预训练模型上添加适配器层的方法相比,显著减少可训练参数的数量。
- 通过重用冻结的单模态基础模型,实现在低数据和领域内学习中的高效性。
- 提供一个模块化、可扩展的框架,可轻松适配新的或改进的预训练模型。
- 证明参数效率不会损害下游视觉-语言基准测试的性能。
提出的方法
- MAPL 重用冻结的预训练视觉编码器(如 CLIP)和自回归语言模型(如 GPT),不进行任何微调或适配器层的添加。
- 引入一个轻量级、可学习的映射头,利用成对的图文数据对冻结的视觉和语言编码器的表示空间进行对齐。
- 通过端到端的方式在图像-字幕对上进行训练,使模型能够通过上下文学习泛化到未见过的视觉-语言任务。
- 该方法具有模块化特性,可应用于任意预训练的单模态模型,便于扩展至更新或更优的模型。
- 使用适度计算资源和公开数据集进行训练,训练仅需数小时即可完成。
- 模型利用冻结语言模型的上下文学习能力,仅通过少量少样本示例即可实现泛化。
实验结果
研究问题
- RQ1在冻结的单模态模型之间建立轻量级映射,是否能在视觉-语言任务中实现强大的少样本性能?
- RQ2与在大规模多模态数据上进行微调或使用适配器层的方法相比,MAPL 的表现如何?
- RQ3在低数据和领域内学习设置下,MAPL 是否能通过极少的参数更新实现有效泛化?
- RQ4MAPL 的参数效率是否导致性能下降,还是能够匹配甚至超越更复杂的模型?
- RQ5MAPL 的性能对随机权重初始化的敏感性如何,是否能有效缓解方差问题?
主要发现
- 尽管训练参数量相比 Frozen、Eichenberg 等人(2021)和 Dai 等人(2022)等方法少几个数量级,MAPL 在多个图像字幕生成和 VQA 基准测试中仍实现了更优或具有竞争力的性能。
- 在低数据学习(多模态数据的 1%)设置下,MAPL 显著优于 Frozen,展现出强大的参数效率。
- 在领域内学习中,MAPL 在直接使用 100% 或 1% 的任务特定数据进行训练(无需预训练)的条件下,其性能仍优于相同条件下的 Frozen。
- MAPL 仅需使用适度计算资源和公开数据集,数小时内即可完成训练,使小型实验室和独立研究者也能轻松使用。
- 模型在不同随机种子下的性能存在不可忽视的方差,可能源于其可训练参数数量较少,但各种子的平均性能保持稳定。
- MAPL 在上下文学习中难以有效利用更多样本,可能是因为其仅在单张图像-字幕对上进行训练,而非多示例序列,提示需要改进的预训练任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。