[论文解读] Generative Multimodal Models are In-Context Learners
本文介绍了 Emu2,一个参数量为 37B 的生成式多模态模型,通过在大规模多模态序列(文本、图像、视频)上采用统一的自回归目标进行训练。该模型在视觉-语言任务中展现出强大的上下文学习能力,在 VQA 基准测试中实现了最先进(SOTA)的少样本性能,并支持零样本视觉提示生成与主体驱动的图像生成,确立了其作为多模态理解与生成通用基础模型的地位。
The human ability to easily solve multimodal tasks in context (i.e., with only a few demonstrations or simple instructions), is what current multimodal systems have largely struggled to imitate. In this work, we demonstrate that the task-agnostic in-context learning capabilities of large multimodal models can be significantly enhanced by effective scaling-up. We introduce Emu2, a generative multimodal model with 37 billion parameters, trained on large-scale multimodal sequences with a unified autoregressive objective. Emu2 exhibits strong multimodal in-context learning abilities, even emerging to solve tasks that require on-the-fly reasoning, such as visual prompting and object-grounded generation. The model sets a new record on multiple multimodal understanding tasks in few-shot settings. When instruction-tuned to follow specific instructions, Emu2 further achieves new state-of-the-art on challenging tasks such as question answering benchmarks for large multimodal models and open-ended subject-driven generation. These achievements demonstrate that Emu2 can serve as a base model and general-purpose interface for a wide range of multimodal tasks. Code and models are publicly available to facilitate future research.
研究动机与目标
- 探究大规模生成式多模态模型是否能够表现出类似于大型语言模型的上下文学习能力。
- 通过实现零样本或少样本的泛化能力,克服特定任务架构和监督微调的局限性,以应对多样化的多模态任务。
- 开发一个统一且可扩展的多模态基础模型,支持文本、图像和视频的理解与生成。
- 在少样本和指令微调设置下,评估模型在未见多模态任务上的表现。
- 分析此类强大生成式模型的社会影响,并倡导负责任的部署。
提出的方法
- 使用统一的自回归目标训练 Emu2:预测序列中下一个多模态元素(文本标记或视觉嵌入)
- 采用三部分架构:视觉编码器(EVA-02-CLIP-E-plus)、多模态建模主干(LLaMA-33B)和视觉解码器(SDXL)
- 通过平均池化将输入图像划分为 8×8 的图像块,并将它们投影到多模态序列中,以支持自回归建模
- 在多样化数据集(包括 LAION-2B、WebVid-10M、MMC4、YT-Storyboard-1B 和 GRIT-20M)上进行预训练,以实现广泛的多模态理解能力
- 通过对话和指令跟随数据的指令微调来优化模型,以提升零样本和少样本性能
- 使用基于扩散的生成方法,结合无分类器引导(scale=3.0)和 EulerDiscreteScheduler,用于图像和视频生成任务

实验结果
研究问题
- RQ1大规模生成式多模态模型是否能够在无需特定任务微调的情况下,通过上下文学习掌握多样化的多模态任务?
- RQ2在多模态设置中,模型规模的提升在多大程度上增强了上下文学习能力,特别是在视觉提示等推理密集型任务中?
- RQ3统一的自回归目标在多大程度上能够实现文本、图像和视频的联合理解与生成?
- RQ4指令微调在多大程度上能够进一步提升模型在多模态生成和视觉问答任务中理解复杂指令的能力?
- RQ5此类强大上下文学习模型在现实世界部署中存在哪些局限性和风险?
主要发现
- Emu2 在多个视觉-语言基准测试(包括 VQAv2、VizWiz、GQA 和 OKVQA)中实现了最先进(SOTA)的少样本性能,展现出强大的上下文学习能力。
- 该模型表现出新兴的推理能力,例如视觉提示生成和基于对象的图像生成,即使在零样本或少样本设置中亦然。
- 经过指令微调后,Emu2 在视觉问答基准测试中超越了先前所有模型,尽管其架构更为简单,但仍取得了新的 SOTA 结果。
- Emu2 能够通过混合输入(文本、图像、布局)实现高质量的可控视觉生成,DreamBench 测试结果表明其输出与人类偏好高度对齐。
- 随着上下文窗口大小的增加,性能持续提升,表明上下文学习具有可扩展性和数据高效性。
- 该模型在未见过的任务上表现出强大的泛化能力,包括开放式图像和视频生成,GPT-4 评估显示输出质量极高。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。