[论文解读] Weakly-supervised VisualBERT: Pre-training without Parallel Images and Captions
本文提出弱监督视觉BERT(Weakly-supervised VisualBERT),一种在无配对图像与标题的情况下进行预训练的视觉-语言模型,通过在仅语言和仅图像的语料上采用掩码与预测目标,并利用目标检测标签作为跨模态锚点。该模型性能可与完全监督预训练模型相媲美,且在大规模原始图像上进行预训练时表现进一步提升。
Pre-trained contextual vision-and-language (V&L) models have brought impressive performance improvement on various benchmarks. However, the paired text-image data required for pre-training are hard to collect and scale up. We investigate if a strong V&L representation model can be learned without text-image pairs. We propose Weakly-supervised VisualBERT with the key idea of conducting mask-and-predict pre-training on language-only and image-only corpora. Additionally, we introduce the object tags detected by an object recognition model as anchor points to bridge two modalities. Evaluation on four V&L benchmarks shows that Weakly-supervised VisualBERT achieves similar performance with a model pre-trained with paired data. Besides, pre-training on more image-only data further improves a model that already has access to aligned data, suggesting the possibility of utilizing billions of raw images available to enhance V&L models.
研究动机与目标
- 探究是否可以在无配对图像-标题数据的情况下学习到强大的视觉-语言表征。
- 减少视觉-语言模型对昂贵且难以获取的配对训练数据的依赖。
- 探索在未配对图像和文本语料上使用掩码预测目标进行预训练的可行性。
- 评估目标检测标签是否能在弱监督设置下有效连接视觉与语言模态。
- 评估在大规模原始图像上进行图像单模态预训练对下游视觉-语言性能的影响。
提出的方法
- 在仅语言语料上使用掩码语言建模目标进行模型预训练。
- 在仅图像语料上使用掩码图像建模目标进行模型预训练。
- 引入预训练目标检测器生成的检测标签作为跨模态锚点,以对齐视觉与文本表征。
- 使用标准微调协议在下游视觉-语言基准上对统一模型进行微调。
- 采用多模态Transformer架构,通过交叉注意力机制联合编码视觉特征与文本标记。
- 端到端训练模型,利用来自目标检测标签的对比学习信号以对齐模态。
实验结果
研究问题
- RQ1在预训练阶段完全不使用任何配对图像-标题数据的情况下,视觉-语言模型能否实现强大性能?
- RQ2在未配对图像和文本语料上进行掩码预训练,是否能产生与监督预训练相媲美或更具竞争力的表征?
- RQ3在缺乏配对数据的情况下,目标检测标签能否作为有效的跨模态锚点,以对齐视觉与语言表征?
- RQ4即使存在配对数据,基于大规模原始图像进行预训练是否仍能提升性能?
- RQ5在弱监督视觉-语言学习中,图像单模态预训练与文本单模态预训练的相对贡献如何?
主要发现
- 弱监督视觉BERT在四个视觉-语言基准上的表现与使用配对图像-标题数据进行预训练的模型相当。
- 即使在存在配对数据的情况下,该模型在大规模图像单模态数据上进行预训练后仍显著获益,表明原始图像具有重要价值。
- 利用目标检测标签作为锚点,可在无需配对样本的情况下实现有效的跨模态对齐。
- 在未配对的语言和图像语料上进行掩码预训练,可生成鲁棒且泛化能力强的视觉-语言表征。
- 图像单模态预训练带来的性能提升表明,数十亿张原始、未配对的图像可显著增强视觉-语言模型。
- 结果证明,从弱监督、未配对的数据源中学习强大视觉-语言表征是可行的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。