[论文解读] Unsupervised Vision-and-Language Pre-training Without Parallel Images and Captions
本文提出无监督视觉BERT(U-VisualBERT),一种视觉-语言预训练方法,通过在未对齐的文本和图像语料上应用掩码-预测目标,并使用目标检测器标签作为跨模态锚点,实现无需对齐图像-标题对的跨模态表征学习。该方法在四个英文视觉-语言基准测试中表现接近监督模型,挑战了强视觉-语言表征学习对平行数据的必要性。
Pre-trained contextual vision-and-language (V&L) models have achieved impressive performance on various benchmarks. However, existing models require a large amount of parallel image-caption data for pre-training. Such data are costly to collect and require cumbersome curation. Inspired by unsupervised machine translation, we investigate if a strong V&L representation model can be learned through unsupervised pre-training without image-caption corpora. In particular, we propose to conduct ``mask-and-predict'' pre-training on text-only and image-only corpora and introduce the object tags detected by an object recognition model as anchor points to bridge two modalities. We find that such a simple approach achieves performance close to a model pre-trained with aligned data, on four English V&L benchmarks. Our work challenges the widely held notion that aligned data is necessary for V&L pre-training, while significantly reducing the amount of supervision needed for V&L models.
研究动机与目标
- 探究是否可以在不使用平行图像-标题数据的情况下学习到强大的视觉-语言表征。
- 挑战广泛持有的观点,即对齐数据对有效的视觉-语言预训练至关重要。
- 探索仅使用未对齐的文本和图像语料进行无监督预训练,且监督程度最低。
- 评估目标检测器标签在缺乏配对数据的情况下是否可作为有效的跨模态锚点。
- 评估结合对齐与未对齐数据进行半监督预训练的潜力。
提出的方法
- 模型在仅文本语料上应用掩码-预测目标,预测自然语言序列中的掩码词。
- 模型在仅图像语料上应用掩码-预测目标,预测掩码的视觉区域及其检测到的对象标签。
- 将目标检测器标签(如“蛋糕”、“汽车”)作为文本标记附加到视觉输入中,以创建跨模态对齐信号。
- 模型使用单一Transformer编码器处理两种模态输入,实现联合表征学习。
- 检测器标签作为模态间的共享词汇元素,实现在无配对样本情况下的隐式跨模态定位。
- 通过受控实验比较使用与不使用对齐训练的模型,以及通过消融研究评估检测器标签的作用。
实验结果
研究问题
- RQ1是否可以完全不依赖平行图像-标题数据来学习强大的视觉-语言表征?
- RQ2目标检测器标签是否可作为有效锚点,连接未对齐的文本与图像模态?
- RQ3在下游任务性能方面,无监督预训练与监督预训练相比如何?
- RQ4在半监督设置下,将未对齐图像数据与少量对齐数据结合,是否能提升性能?
- RQ5在缺乏配对样本的情况下,检测器标签在实现跨模态对齐中起到什么作用?
主要发现
- 在NLVR2基准测试中,U-VisualBERT达到70.49%的准确率,与监督模型S-VisualBERT的70.90%非常接近。
- 在VQA基准测试中,U-VisualBERT获得67.4%的top-1准确率,与监督基线的67.7%相当。
- 在GQA基准测试中,U-VisualBERT达到71.1%的准确率,略低于监督模型的71.8%,但仍具高度竞争力。
- 在Flickr30K中,U-VisualBERT在图像-文本匹配任务上达到81.2%的性能,展现出强大的零样本迁移能力。
- 消融研究显示,若移除检测器标签(U-VisualBERT_NT),性能显著下降,证实其作为关键对齐信号的作用。
- 使用300万对齐图像和170万未对齐图像进行半监督预训练(H-VisualBERT)在大多数任务上均优于监督预训练,表明未对齐数据具有显著价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。