[论文解读] Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks
BEiT-3 是一种通用型多模态基础模型,使用跨图像、文本和图像-文本对的掩码数据建模结合多路 Transformer,在视觉和视觉-语言任务上实现了最先进的迁移性能。
A big convergence of language, vision, and multimodal pretraining is emerging. In this work, we introduce a general-purpose multimodal foundation model BEiT-3, which achieves state-of-the-art transfer performance on both vision and vision-language tasks. Specifically, we advance the big convergence from three aspects: backbone architecture, pretraining task, and model scaling up. We introduce Multiway Transformers for general-purpose modeling, where the modular architecture enables both deep fusion and modality-specific encoding. Based on the shared backbone, we perform masked "language" modeling on images (Imglish), texts (English), and image-text pairs ("parallel sentences") in a unified manner. Experimental results show that BEiT-3 obtains state-of-the-art performance on object detection (COCO), semantic segmentation (ADE20K), image classification (ImageNet), visual reasoning (NLVR2), visual question answering (VQAv2), image captioning (COCO), and cross-modal retrieval (Flickr30K, COCO).
研究动机与目标
- 在单一的基础模型下推动视觉与语言预训练的统一
- 提出一个支持模态特定编码和跨模态融合的通用骨干(多路 Transformer)
- 主张一个统一的预训练目标:对图像、文本和图像-文本对进行掩码数据建模
- 展示扩大模型规模和数据规模对多样化下游任务迁移的提升
- 展示基于公共资源的预训练在各任务上达到与SOTA相竞争的结果
提出的方法
- 采用具有模态特定专家与共享自注意力的多路 Transformer,以实现深度融合与模态特定编码
- 定义统一的预训练任务:对单模态与多模态数据进行掩码后再预测(掩码数据建模),将图像视为一种外语(Imglish)
- 使用 SentencePiece 对文本进行分词,将 BEiT v2 的视觉标记作为重建目标对图像进行重建
- 对文本令牌(单模态)掩码 15%,对图像-文本对的文本令牌掩码 50%;对图像补丁掩码 40%,采用块级掩码
- 使用公开数据源对 BEiT-3 的40层架构(约19亿参数)进行预训练;每步的批量包括2048张图像、2048段文本、2048个图像-文本对
- 使下游迁移在不同模式下可用(视觉编码器、检索的双编码器、面向多模态任务的融合编码器)
实验结果
研究问题
- RQ1一个单一、统一的体系结构(多路 Transformer)是否能够高效支持视觉和视觉-语言任务?
- RQ2对图像、文本和图像-文本对仅使用一个掩码数据建模目标,是否足以学习可迁移的多模态表示?
- RQ3模型规模和数据规模的扩张在广泛的视觉与视觉-语言基准测试中如何影响性能?
主要发现
- BEiT-3 在多样化任务上实现了最先进的迁移,包括 COCO 目标检测(AP)、COCO 实例分割(AP)、ADE20K 语义分割(mIoU)、ImageNet 分类(Top-1)、NLVR2 视觉推理、VQAv2 视觉问答、COCO 图像描述生成(CIDEr),以及跨模态检索(Flickr30K、COCO)
- 在视觉任务上,BEiT-3 仅使用公开数据资源进行预训练和微调即可达到或超过此前的 SOTA
- 在视觉-语言任务上,BEiT-3 超越前沿,在 VQA、NLVR2、描述生成和检索基准上实现更强的跨模态对齐,证明了基于掩码的预训练的有效性
- 零-shot 与微调检索结果显示 BEiT-3 与此前模型相比具有竞争力或更优,COCO 与 Flickr30K 检索方面的提升尤为显著
- 语义分割和图像分类结果表明 BEiT-3 在单一统一模型下提供顶级准确度
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。