[论文解读] BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
BLIP 提出了一种统一的视觉-语言预训练框架(MED),并采用一个基于字幕生成与过滤的数据自举(CapFilt)策略,从嘈杂的网页图片-文本对中学习,在理解和生成任务上达到最先进的水平,并在零样本视频-语言迁移方面表现出色。
Vision-Language Pre-training (VLP) has advanced the performance for many vision-language tasks. However, most existing pre-trained models only excel in either understanding-based tasks or generation-based tasks. Furthermore, performance improvement has been largely achieved by scaling up the dataset with noisy image-text pairs collected from the web, which is a suboptimal source of supervision. In this paper, we propose BLIP, a new VLP framework which transfers flexibly to both vision-language understanding and generation tasks. BLIP effectively utilizes the noisy web data by bootstrapping the captions, where a captioner generates synthetic captions and a filter removes the noisy ones. We achieve state-of-the-art results on a wide range of vision-language tasks, such as image-text retrieval (+2.7% in average recall@1), image captioning (+2.8% in CIDEr), and VQA (+1.6% in VQA score). BLIP also demonstrates strong generalization ability when directly transferred to video-language tasks in a zero-shot manner. Code, models, and datasets are released at https://github.com/salesforce/BLIP.
研究动机与目标
- 旨在创建一个在视觉-语言理解与生成任务上都表现出色的单一模型。
- 通过字幕者和过滤器对字幕进行自举,以解决嘈杂网页文本的次优性。
- 开发一个支持多模态和多任务的灵活模型架构。
- 利用数据增强管线(CapFilt)来提升预训练数据质量。
- 在零样本设定下展示对视频-语言任务的强迁移性能。
提出的方法
- 引入多模态编码器-解码器混合(MED),在一个统一模型中实现单模态编码器、图像为基础的文本编码器和图像为基础的文本解码器。
- 通过三个目标进行预训练:图像-文本对比(ITC)、图像-文本匹配(ITM)和用于字幕生成的语言模型(LM)。
- 在文本编码器和解码器之间共享参数,除了自注意力层(SA)以实现多任务训练的效率。
- CapFilt 通过以下方式自举网页数据:(i)字幕生成器为网页图片生成合成字幕,(ii)过滤器通过 ITM/ITC 信号去除嘈杂字幕,(iii)将清洗后网页数据与人工标注数据结合用于预训练。
- 使用核采样(nucleus sampling)来生成合成字幕,以提升多样性和模型学习。
- 通过对数据集规模、骨干网络和参数共享进行大量消融研究来优化 CapFilt 的有效性。
实验结果
研究问题
- RQ1一个统一的视觉-语言模型(MED)是否能够在理解和生成任务上都表现出色?
- RQ2用合成字幕对嘈杂网页数据进行自举并加入过滤步骤,是否能提升下游的视觉-语言性能?
- RQ3数据多样性和参数共享策略如何影响预训练效率和下游结果?
- RQ4CapFilt 对零样本和微调任务(包括检索、字幕生成、VQA、NLVR2 和 VisDial)的影响是什么?
- RQ5BLIP 在零样本迁移到视频-语言任务方面的泛化能力如何?
主要发现
- BLIP 在视觉-语言任务上取得了最先进的结果,如图像-文本检索、图像字幕、VQA、视觉推理和视觉对话。
- 对视频-语言任务的零样本迁移(文本到视频检索和视频问答)达到最先进的性能。
- CapFilt 相较于直接使用原始嘈杂网页文本,性能持续提升,在使用更大 backbone 和更多数据时提升更大。
- 通过核采样生成的合成字幕的多样性相较于确定性束搜索带来提升。
- 除了自注意力层外,文本编码器与解码器参数共享提供了性能与效率的良好平衡;解耦的字幕生成器和过滤器通常比完全共享设置表现更好。
- 搭配 CapFilt 自举数据的 ViT-L 骨干网络取得强劲结果,接近甚至达到在更大数据集上训练的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。