[论文解读] Emu3: Next-Token Prediction is All You Need
Emu3 引入了一种统一的多模态基础模型,仅通过下一个标记预测进行训练,将文本、图像和视频标记化为共享的离散空间。它在生成和感知任务中均实现了最先进性能——超越了 SDXL 和 LLaVA-1.6 等模型——且无需依赖扩散模型或组合架构,表明仅通过下一个标记预测即可实现通用多模态智能。
While next-token prediction is considered a promising path towards artificial general intelligence, it has struggled to excel in multimodal tasks, which are still dominated by diffusion models (e.g., Stable Diffusion) and compositional approaches (e.g., CLIP combined with LLMs). In this paper, we introduce Emu3, a new suite of state-of-the-art multimodal models trained solely with next-token prediction. By tokenizing images, text, and videos into a discrete space, we train a single transformer from scratch on a mixture of multimodal sequences. Emu3 outperforms several well-established task-specific models in both generation and perception tasks, surpassing flagship models such as SDXL and LLaVA-1.6, while eliminating the need for diffusion or compositional architectures. Emu3 is also capable of generating high-fidelity video via predicting the next token in a video sequence. We simplify complex multimodal model designs by converging on a singular focus: tokens, unlocking great potential for scaling both during training and inference. Our results demonstrate that next-token prediction is a promising path towards building general multimodal intelligence beyond language. We open-source key techniques and models to support further research in this direction.
研究动机与目标
- 探究仅通过下一个标记预测是否足以在多模态任务中实现最先进性能,挑战扩散模型和组合架构的主导地位。
- 通过将视觉、语言和视频统一于单一的下一个标记预测目标下,消除架构复杂性。
- 证明仅从零开始训练一个 Transformer 模型处理多模态序列,即可在生成和感知任务中达到或超越专用模型的性能。
- 通过专注于仅基于标记的预测,简化模型设计,实现可扩展的训练与推理。
提出的方法
- 使用可学习标记器将图像、文本和视频标记化为共享的离散空间,实现联合建模。
- 从零开始在多模态序列混合数据上训练单一的 Transformer 解码器,仅以下一个标记预测作为唯一目标。
- 模型以统一的自回归方式处理来自不同模态的标记序列,预测序列中的下一个标记。
- 通过自回归地依次预测对应于视频帧的标记,实现高保真视频合成。
- 训练数据包含多样化的多模态序列,包括图文对、文本视频对和图像视频对,支持零样本泛化。
- 架构避免使用扩散模型、对比预训练或模块化融合,所有能力均仅依赖于下一个标记预测。
实验结果
研究问题
- RQ1仅通过下一个标记预测是否足以在多模态生成和感知任务中实现最先进性能?
- RQ2一个仅通过下一个标记预测训练的统一自回归 Transformer 模型是否优于 SDXL 和 LLaVA-1.6 等专用模型?
- RQ3一个在文本、图像和视频序列混合数据上训练的单一模型,是否能通过自回归标记预测生成高保真视频?
- RQ4通过消除扩散模型和组合组件,多模态模型的架构复杂性可降低到何种程度?
- RQ5下一个标记预测是否足以支持超越语言的通用多模态智能?
主要发现
- Emu3 在多个基准测试中均优于 SDXL 的文生图生成性能,FID 和 CLIP 分数更高。
- Emu3 在视觉问答和图像字幕生成任务中超越 LLaVA-1.6,展现出更强的感知能力。
- 模型通过自回归地依次预测视频序列中的标记,实现高保真视频生成,质量具有竞争力。
- Emu3 在无需使用扩散模型或对比预训练的情况下,实现了生成和感知任务的最先进结果。
- 模型在多样化的多模态任务中展现出强大的零样本泛化能力,表明下一个标记预测目标具有强大鲁棒性。
- 通过移除扩散头或模态专用编码器等复杂组件,训练与推理过程得以简化,同时保持或提升了性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。