[论文解读] What Vision-Language Models `See' when they See Scenes
本文研究了视觉-语言模型在物体级和场景级图像描述上的对齐能力,发现只有CLIP在两类任务上均表现稳定,其通过利用视觉物体特征来实现对场景级描述的语义定位。研究揭示,CLIP的优越性能源于其对比学习预训练目标和视觉Transformer主干网络,而其他模型如LXMERT和VisualBERT则在风格和语义分布偏移下表现不佳。
Images can be described in terms of the objects they contain, or in terms of the types of scene or place that they instantiate. In this paper we address to what extent pretrained Vision and Language models can learn to align descriptions of both types with images. We compare 3 state-of-the-art models, VisualBERT, LXMERT and CLIP. We find that (i) V&L models are susceptible to stylistic biases acquired during pretraining; (ii) only CLIP performs consistently well on both object- and scene-level descriptions. A follow-up ablation study shows that CLIP uses object-level information in the visual modality to align with scene-level textual descriptions.
研究动机与目标
- 评估视觉-语言模型是否能可靠地与物体级和场景级图像描述对齐。
- 探究模型是否学习到场景语义与构成物体之间的关联。
- 比较三种先进视觉-语言模型在多样化描述风格下的零样本性能。
- 通过消融实验识别CLIP中对成功定位有贡献的视觉与文本组件。
提出的方法
- 本研究在零样本图像-文本匹配设置下评估VisualBERT、LXMERT和CLIP,使用三个数据集:ADE20K、Localized Narratives(LN)以及新提出的HL1K数据集。
- 通过零样本检索性能评估图像-文本匹配,衡量模型在未微调情况下检索正确图像-文本配对的能力。
- 对CLIP进行消融实验,以分离视觉物体特征与文本场景描述对对齐性能的贡献。
- 从预训练数据规模、网络架构(双流与单流)以及目标函数(如CLIP的对比学习与其它模型的掩码语言建模)等方面对模型进行比较。
- 引入HL1K数据集,该数据集由亚马逊Mechanical Turk众包收集,包含场景级描述。
- 采用标准检索指标(如图像-文本匹配任务的top-1和top-5准确率)评估性能。
实验结果
研究问题
- RQ1视觉-语言模型能否泛化到其预训练数据中风格不同的场景级描述?
- RQ2在物体中心描述上训练的模型是否也能在场景级描述上表现良好?
- RQ3在视觉-语言模型中,哪些视觉与文本组件对场景级描述的定位最为关键?
- RQ4为何CLIP在物体级与场景级定位任务上均优于其他模型?
主要发现
- 只有CLIP在物体级和场景级图像-文本匹配任务上表现一致出色,而LXMERT和VisualBERT在场景级描述上的性能显著下降。
- CLIP在HL1K数据集上实现了强大的零样本性能,该数据集包含其预训练期间未见过的场景级描述。
- 消融实验表明,CLIP依赖于物体级视觉特征来与场景级文本描述对齐,表明物体感知有助于场景理解。
- 尽管参数量少于LXMERT,CLIP仍表现更优,表明模型规模本身并不能决定定位能力。
- CLIP的对比学习预训练目标和视觉Transformer主干网络是其卓越性能的关键因素,表明架构与训练目标的选择比规模本身更为重要。
- LXMERT和VisualBERT对预训练数据中的风格偏差敏感,难以泛化到与其预训练语料中语言风格不同的描述。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。