[论文解读] Scaling Up Vision-Language Pre-training for Image Captioning
该论文提出了 LEMON,一个用于图像字幕生成的大规模视觉-语言预训练模型,通过同时扩大模型规模(参数量从 13M 增至 675M)和预训练数据规模(从网络辅助文字描述中获取的高达 2 亿张图像-文本对,称为 ALT200M),实现了显著的性能提升。实验表明,随着模型和数据规模的增加,性能显著提高,在 COCO Caption、nocaps 和 Conceptual Captions 上均取得了新的 SOTA 结果,包括对长尾视觉概念的强零样本泛化能力。
In recent years, we have witnessed significant performance boost in the image captioning task based on vision-language pre-training (VLP). Scale is believed to be an important factor for this advance. However, most existing work only focuses on pre-training transformers with moderate sizes (e.g., 12 or 24 layers) on roughly 4 million images. In this paper, we present LEMON, a LargE-scale iMage captiONer, and provide the first empirical study on the scaling behavior of VLP for image captioning. We use the state-of-the-art VinVL model as our reference model, which consists of an image feature extractor and a transformer model, and scale the transformer both up and down, with model sizes ranging from 13 to 675 million parameters. In terms of data, we conduct experiments with up to 200 million image-text pairs which are automatically collected from web based on the alt attribute of the image (dubbed as ALT200M). Extensive analysis helps to characterize the performance trend as the model size and the pre-training data size increase. We also compare different training recipes, especially for training on large-scale noisy data. As a result, LEMON achieves new state of the arts on several major image captioning benchmarks, including COCO Caption, nocaps, and Conceptual Captions. We also show LEMON can generate captions with long-tail visual concepts when used in a zero-shot manner.
研究动机与目标
- 研究视觉-语言预训练(VLP)在图像字幕生成任务中,模型规模与数据规模的扩展行为。
- 构建一个大规模、网络爬取的图像-文本数据集(ALT200M),基于辅助文字属性,以支持大规模预训练。
- 评估不同模型架构与训练目标的有效性,尤其是在噪声大、规模大的数据条件下的表现。
- 建立视觉-语言预训练在图像字幕生成中的经验性扩展规律,识别模型容量与数据量之间的最优权衡。
- 证明在大规模噪声数据上预训练的大模型能够实现 SOTA 性能,并实现对长尾视觉概念的零样本泛化。
提出的方法
- 构建了 ALT200M 数据集,包含最多 20340 万张图像-文本对,数据来源于网络辅助文字描述,具有较高的长尾概念覆盖率。
- 以 VinVL 模型为基础架构,通过扩展其 Transformer 深度与宽度,构建了参数量从 13M 到 675M 的多种模型。
- 调整预训练目标,使其与下游字幕生成任务保持一致,采用序列到序列的掩码语言建模(s2s-MLM)。
- 通过控制变量实验,改变模型规模与数据规模(从 300 万到 2000 万样本),在 ALT200M 上进行训练,并在 COCO、nocaps 和 Conceptual Captions 上进行评估。
- 通过消融实验比较不同模型架构(仅编码器 vs. 编码器-解码器)与训练目标(语言建模 LM vs. s2s-MLM)的性能,尤其关注在噪声数据条件下的表现。
- 通过在 COCO 上微调并在域外的 nocaps 上测试,评估泛化能力,分析学习曲线与数据效率。
实验结果
研究问题
- RQ1当在不断扩大的数据集上进行预训练时,模型规模如何影响图像字幕生成的性能?
- RQ2在数据为噪声大、网络爬取的条件下,预训练数据规模对下游字幕生成性能有何影响?
- RQ3在大规模、噪声数据设置下,哪种训练目标(如 LM 与 s2s-MLM)在图像字幕生成中表现更优?
- RQ4大规模 VLP 模型能否以零样本方式泛化到长尾视觉概念?
- RQ5模型容量与数据规模如何相互作用,以决定学习效率与性能饱和点?
主要发现
- LEMON 在 COCO Caption 的 Karpathy 测试集上取得了 120.9 的新 SOTA CIDEr 分数,超越了先前所有方法。
- 在 Conceptual Captions 上,模型取得了 104.4 的 CIDEr 分数,展现出在噪声大、开放域数据上的强大性能。
- 在小数据集(<1000 万)上,扩大模型规模带来的性能增益微乎其微;但当数据集超过 1000 万时,性能增益变得显著,表明存在依赖数据的扩展阈值。
- 在 80 亿样本上训练的“巨型”模型(675M 参数)优于在 190 亿样本上训练的“基础”模型,表明大模型具有更高的数据效率。
- s2s-MLM 目标优于标准语言建模(LM),尤其在噪声数据中表现更优,且对学习率超参数的敏感度更低。
- LEMON 展现出强大的零样本泛化能力,能够有效生成在微调阶段未见过的长尾视觉概念的字幕。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。