Skip to main content
QUICK REVIEW

[论文解读] Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks

Wenhui Wang, Hangbo Bao|arXiv (Cornell University)|Aug 22, 2022
Multimodal Machine Learning Applications被引用 150
一句话总结

BEiT-3 是一种通用型多模态基础模型,使用跨图像、文本和图像-文本对的掩码数据建模结合多路 Transformer,在视觉和视觉-语言任务上实现了最先进的迁移性能。

ABSTRACT

A big convergence of language, vision, and multimodal pretraining is emerging. In this work, we introduce a general-purpose multimodal foundation model BEiT-3, which achieves state-of-the-art transfer performance on both vision and vision-language tasks. Specifically, we advance the big convergence from three aspects: backbone architecture, pretraining task, and model scaling up. We introduce Multiway Transformers for general-purpose modeling, where the modular architecture enables both deep fusion and modality-specific encoding. Based on the shared backbone, we perform masked "language" modeling on images (Imglish), texts (English), and image-text pairs ("parallel sentences") in a unified manner. Experimental results show that BEiT-3 obtains state-of-the-art performance on object detection (COCO), semantic segmentation (ADE20K), image classification (ImageNet), visual reasoning (NLVR2), visual question answering (VQAv2), image captioning (COCO), and cross-modal retrieval (Flickr30K, COCO).

研究动机与目标

  • 在单一的基础模型下推动视觉与语言预训练的统一
  • 提出一个支持模态特定编码和跨模态融合的通用骨干(多路 Transformer)
  • 主张一个统一的预训练目标:对图像、文本和图像-文本对进行掩码数据建模
  • 展示扩大模型规模和数据规模对多样化下游任务迁移的提升
  • 展示基于公共资源的预训练在各任务上达到与SOTA相竞争的结果

提出的方法

  • 采用具有模态特定专家与共享自注意力的多路 Transformer,以实现深度融合与模态特定编码
  • 定义统一的预训练任务:对单模态与多模态数据进行掩码后再预测(掩码数据建模),将图像视为一种外语(Imglish)
  • 使用 SentencePiece 对文本进行分词,将 BEiT v2 的视觉标记作为重建目标对图像进行重建
  • 对文本令牌(单模态)掩码 15%,对图像-文本对的文本令牌掩码 50%;对图像补丁掩码 40%,采用块级掩码
  • 使用公开数据源对 BEiT-3 的40层架构(约19亿参数)进行预训练;每步的批量包括2048张图像、2048段文本、2048个图像-文本对
  • 使下游迁移在不同模式下可用(视觉编码器、检索的双编码器、面向多模态任务的融合编码器)

实验结果

研究问题

  • RQ1一个单一、统一的体系结构(多路 Transformer)是否能够高效支持视觉和视觉-语言任务?
  • RQ2对图像、文本和图像-文本对仅使用一个掩码数据建模目标,是否足以学习可迁移的多模态表示?
  • RQ3模型规模和数据规模的扩张在广泛的视觉与视觉-语言基准测试中如何影响性能?

主要发现

  • BEiT-3 在多样化任务上实现了最先进的迁移,包括 COCO 目标检测(AP)、COCO 实例分割(AP)、ADE20K 语义分割(mIoU)、ImageNet 分类(Top-1)、NLVR2 视觉推理、VQAv2 视觉问答、COCO 图像描述生成(CIDEr),以及跨模态检索(Flickr30K、COCO)
  • 在视觉任务上,BEiT-3 仅使用公开数据资源进行预训练和微调即可达到或超过此前的 SOTA
  • 在视觉-语言任务上,BEiT-3 超越前沿,在 VQA、NLVR2、描述生成和检索基准上实现更强的跨模态对齐,证明了基于掩码的预训练的有效性
  • 零-shot 与微调检索结果显示 BEiT-3 与此前模型相比具有竞争力或更优,COCO 与 Flickr30K 检索方面的提升尤为显著
  • 语义分割和图像分类结果表明 BEiT-3 在单一统一模型下提供顶级准确度

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。