[论文解读] PaLI: A Jointly-Scaled Multilingual Language-Image Model
PaLI 是一个联合扩展的多语言 Vision-Language 模型,使用文本对文本接口在多语言环境下执行多种图像-语言任务,利用大型单模态骨干和一个 10B-image WebLI 预训练数据集。
Effective scaling and a flexible task interface enable large language models to excel at many tasks. We present PaLI (Pathways Language and Image model), a model that extends this approach to the joint modeling of language and vision. PaLI generates text based on visual and textual inputs, and with this interface performs many vision, language, and multimodal tasks, in many languages. To train PaLI, we make use of large pre-trained encoder-decoder language models and Vision Transformers (ViTs). This allows us to capitalize on their existing capabilities and leverage the substantial cost of training them. We find that joint scaling of the vision and language components is important. Since existing Transformers for language are much larger than their vision counterparts, we train a large, 4-billion parameter ViT (ViT-e) to quantify the benefits from even larger-capacity vision models. To train PaLI, we create a large multilingual mix of pretraining tasks, based on a new image-text training set containing 10B images and texts in over 100 languages. PaLI achieves state-of-the-art in multiple vision and language tasks (such as captioning, visual question-answering, scene-text understanding), while retaining a simple, modular, and scalable design.
研究动机与目标
- 实现跨多语言的多样化视觉-语言任务的统一图像-文本到文本生成。
- 展示联合扩展视觉与语言骨干网络相较于偏向性扩展的优势。
- 利用可复用的单模态检查点在保持多语言能力的同时降低训练成本。
- 在大型多语言 WebLI 数据集上进行训练,以支持超过 100 种语言和广泛的任务覆盖。
提出的方法
- 使用以 Vision Transformer (ViT) 作为图像编码器的编码器-解码器 Transformer,以及基于预训练的 mT5 的语言组件。
- 引入 ViT-e,一个 4B 参数的视觉骨干,用以研究更大视觉容量的影响。
- 在 WebLI 上进行预训练,该数据集包含 10B 张图像以及数十亿级的图像-文本对,覆盖 100+ 种语言,并包含 OCR 注释。
- 采用包含拆分式字幕、字幕生成、OCR、VQA、VQG 等在内的八任务多任务预训练混合,以促进通用的多模态理解。
- 在高分辨率(224–588)对英语和多语言基准进行微调和评估,以评估跨语言和跨任务的迁移。
实验结果
研究问题
- RQ1联合扩展视觉与语言骨干能否带来比偏向性扩展更好的多模态性能?
- RQ2大型多语言多模态模型在英语及非英语的视觉与语言任务(如字幕生成和 VQA)上的跨语言表现如何?
- RQ3多样化预训练任务混合对多语言视觉与语言能力有何影响?
- RQ4复用单模态检查点是否能在保持语言性能的同时实现多模态任务?
主要发现
- PaLI-17B 在 COCO Captioning 的 Karpathy 分割上以 CIDEr 149.1 达成 SOTA。
- PaLI-17B 在 open-vocabulary 生成中的 VQAv2 准确率为 84.3,超越此前的 SOTA 模型。
- PaLI-17B 的 OKVQA 准确度为 64.5,较之前的预训练-微调结果高出 10.1 点。
- Multilingual Crossmodal-3600 结果在 7 种语言和 35 语言平均上表现强劲,相较以往工作有显著提升。
- 扩展视觉骨干(ViT-e)在视觉-语言任务中产生显著提升,有时比单纯语言扩展更高效。
- PaLI-17B 配合高分辨率预训练在视觉-语言基准上再提升约 2 点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。