[论文解读] mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections
mPLUG 提出了一种视觉-语言基础模型,通过跨模态跳跃连接解决多模态学习中的信息不对称和计算效率低下问题。通过在视觉与语言表征之间实现异步融合的层间快捷连接,mPLUG 在视觉-语言任务上实现了最先进性能,并在视频-语言任务上展现出强大的零样本迁移能力,优于参数量更大的模型,且预训练数据更少。
Large-scale pretrained foundation models have been an emerging paradigm for building artificial intelligence (AI) systems, which can be quickly adapted to a wide range of downstream tasks. This paper presents mPLUG, a new vision-language foundation model for both cross-modal understanding and generation. Most existing pre-trained models suffer from the problems of low computational efficiency and information asymmetry brought by the long visual sequence in cross-modal alignment. To address these problems, mPLUG introduces an effective and efficient vision-language architecture with novel cross-modal skip-connections, which creates inter-layer shortcuts that skip a certain number of layers for time-consuming full self-attention on the vision side. mPLUG is pre-trained end-to-end on large-scale image-text pairs with both discriminative and generative objectives. It achieves state-of-the-art results on a wide range of vision-language downstream tasks, such as image captioning, image-text retrieval, visual grounding and visual question answering. mPLUG also demonstrates strong zero-shot transferability when directly transferred to multiple video-language tasks.
研究动机与目标
- 解决视觉与语言模态之间的信息不对称问题,即图像包含比简短、抽象的标题更丰富的视觉细节。
- 通过减少对长视觉序列的完整自注意力计算,提升视觉-语言模型的计算效率。
- 设计统一架构以同时支持视觉-语言理解与生成任务。
- 在无需微调的情况下,实现对视频-语言任务的强大零样本泛化能力。
- 在降低计算成本和参数效率的前提下,实现最先进性能。
提出的方法
- 引入跨模态跳跃连接,创建层间快捷连接,使视觉表征可跳过多个层,与高层语言表征对齐。
- 采用异步协同注意力机制,仅在语言侧应用协同注意力,降低视觉侧的计算量。
- 使用混合融合策略:先进行早期异步协同注意力,再通过一个连接注意力层融合拼接后的视觉与语言特征。
- 在大规模图像-文本对上端到端预训练 mPLUG,采用对比损失和前缀语言建模目标。
- 利用残差风格快捷连接缓解训练过程中的梯度消失问题。
- 对视频输入采用均匀采样和特征拼接,实现对视频任务的零样本迁移。
实验结果
研究问题
- RQ1跨模态跳跃连接是否能有效降低视觉-语言模型的计算成本,同时保持或提升性能?
- RQ2视觉与语言表征之间的异步融合在多模态对齐中如何缓解信息不对称问题?
- RQ3在零样本设置下,基于图像-文本数据预训练的视觉-语言模型在视频-语言任务上的泛化能力达到何种程度?
- RQ4统一架构是否能在视觉-语言理解与生成任务中均实现最先进性能?
- RQ5与更大模型相比,mPLUG 在效率和零样本迁移能力方面表现如何?
主要发现
- mPLUG 在图像字幕生成任务上实现最先进性能,在 NoCaps 验证集上 CIDEr 得分为 122.5,优于完全监督的 SimVLM huge 模型。
- 在图像-文本检索任务中,mPLUG 在 Flickr30K 上达到 R@1 为 44.3,R@5 为 66.4,超越 CLIP 和 Florence 等模型,即使预训练数据更少。
- 在 MSRVTT 的零样本视频-文本检索中,mPLUG 达到 38.1% 的 R@1,优于 VideoCLIP 和 VIOLET,并与在大规模视频数据集上微调的模型相当。
- 在 MSRVTT-QA 的零样本视频问答任务中,mPLUG 达到 21.1% 的准确率,超过 BLIP 的 19.2%,且无需额外视频预训练。
- 在视频字幕生成任务中,mPLUG 在 VATEX 上取得 42.0 的 CIDEr 得分,优于 BLIP 的 37.4,展现出强大的零样本生成能力。
- 跨模态跳跃连接网络的推理时间相比传统融合网络至少减少四倍,同时保持或提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。