Skip to main content
QUICK REVIEW

[论文解读] MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning

Constantin Eichenberg, Sidney Black|arXiv (Cornell University)|Dec 9, 2021
Multimodal Machine Learning Applications被引用 5
一句话总结

MAGMA 提出了一种参数高效的微调方法,通过基于适配器的微调,将视觉能力引入冻结的生成式语言模型,实现从任意视觉和文本输入进行端到端的多模态生成。该方法在 OKVQA 上达到最先进性能,在其他基准上也表现优异,且仅使用 SimVLM 所用数据量的约 0.2% 进行训练。

ABSTRACT

Large-scale pretraining is fast becoming the norm in Vision-Language (VL) modeling. However, prevailing VL approaches are limited by the requirement for labeled data and the use of complex multi-step pretraining objectives. We present MAGMA - a simple method for augmenting generative language models with additional modalities using adapter-based finetuning. Building on Frozen, we train a series of VL models that autoregressively generate text from arbitrary combinations of visual and textual input. The pretraining is entirely end-to-end using a single language modeling objective, simplifying optimization compared to previous approaches. Importantly, the language model weights remain unchanged during training, allowing for transfer of encyclopedic knowledge and in-context learning abilities from language pretraining. MAGMA outperforms Frozen on open-ended generative tasks, achieving state of the art results on the OKVQA benchmark and competitive results on a range of other popular VL benchmarks, while pretraining on 0.2% of the number of samples used to train SimVLM.

研究动机与目标

  • 开发一种参数高效的方案,将视觉能力集成到冻结的自回归语言模型中,而无需微调语言模型的权重。
  • 通过单一统一的语言建模范式,支持开放域、生成式的多模态任务。
  • 通过引入适配器层和精选的预训练数据集,改进 Frozen 方法,在保持模型知识和上下文学习能力的同时提升性能。
  • 证明少量高质量数据可超越大规模噪声数据集在多模态预训练中的表现。
  • 探索不同视觉编码器和适配器配置在多样化下游视觉-语言任务中的有效性。

提出的方法

  • MAGMA 使用冻结的自回归语言模型(如 GPT-J)作为核心解码器,以基于 CLIP 的 ResNet 视觉编码器作为视觉主干网络。
  • 在语言模型的注意力子层和前馈子层中插入适配器层,仅微调这些适配器参数,而主干语言模型权重保持冻结。
  • 将来自 CLIP 编码器的视觉前缀拼接至输入 token,以实现语言模型对图像特征的条件化。
  • 在约 2500 万张图像-文本对的精选数据集上进行预训练,采用标准的下一项词预测目标。该数据集包含下游任务数据。
  • 该方法无需针对特定任务的头层微调,即可实现零样本和少样本推理。
  • 通过在 VQA、OKVQA 和 NoCaps 等基准上的零样本推理评估模型性能,并在训练集上进行额外微调以提升单任务性能。

实验结果

研究问题

  • RQ1基于适配器的微调能否在保持预训练知识的前提下,有效增强冻结语言模型的视觉能力?
  • RQ2在多模态预训练中,使用小规模精选的高质量图像-文本对数据集是否优于大规模噪声数据集?
  • RQ3不同视觉编码器(如 CLIP-RN50x16 与其他模型)和适配器配置如何影响多样化视觉-语言任务的下游性能?
  • RQ4冻结的语言模型在无显式监督的情况下,能在多大程度上执行复杂推理和 OCR 任务?
  • RQ5通过分步认知提示法,模型能否泛化至多步推理任务?

主要发现

  • MAGMA 在 OKVQA 基准上达到最先进准确率,优于先前方法(包括 Frozen),并可与 SimVLM 竞争。
  • 在 NoCaps 及其他基准上,MAGMA 表现具有竞争力,尽管仅使用 SimVLM 预训练数据量的约 0.2%,其性能仍超过 Frozen 基线。
  • 消融实验表明,CLIP-RN50x16 视觉编码器在性能上显著优于其他视觉主干网络,尤其在开放域推理任务中。
  • 适配器微调模型始终优于仅使用视觉前缀的方法,证明了在语言模型内部表征中进行参数高效适配的重要性。
  • 在预训练数据集中包含下游任务数据可显著提升性能,尤其在 VQA 和图像字幕生成任务中。
  • MAGMA 对能欺骗 CLIP 的对抗性拼写攻击表现出鲁棒性,并在无监督微调下展现出强大的少样本 OCR 和文本补全能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。