[论文解读] Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality
Winoground 引入了一种新颖的探针数据集,通过匹配包含相同词汇但顺序不同的描述语句来评估视觉-语言模型在视觉-语言组合推理方面的能力。令人惊讶的是,最先进模型的表现仅略好于随机猜测,揭示了其在跨模态组合结构理解上的关键缺陷。
We present a novel task and dataset for evaluating the ability of vision and language models to conduct visio-linguistic compositional reasoning, which we call Winoground. Given two images and two captions, the goal is to match them correctly - but crucially, both captions contain a completely identical set of words, only in a different order. The dataset was carefully hand-curated by expert annotators and is labeled with a rich set of fine-grained tags to assist in analyzing model performance. We probe a diverse range of state-of-the-art vision and language models and find that, surprisingly, none of them do much better than chance. Evidently, these models are not as skilled at visio-linguistic compositional reasoning as we might have hoped. We perform an extensive analysis to obtain insights into how future work might try to mitigate these models' shortcomings. We aim for Winoground to serve as a useful evaluation set for advancing the state of the art and driving further progress in the field. The dataset is available at https://huggingface.co/datasets/facebook/winoground.
研究动机与目标
- 开发一个新基准,严格评估视觉-语言模型在视觉与语言模态之间进行组合推理的能力。
- 探究最先进模型能否正确匹配图像与仅词序不同的描述语句,这一任务对人类而言微不足道。
- 通过细致分析模型行为,识别当前多模态架构中的失败模式与性能瓶颈。
- 提供一个标注丰富的数据集,附带细粒度标签,以支持对模型能力的详细诊断评估。
- 通过揭示当前模型在处理视觉-语言理解中组合结构方面的局限性,推动未来研究。
提出的方法
- Winoground 数据集由成对的图像-描述语句组成,其中呈现两幅图像和两个描述语句,两个描述语句包含完全相同的词汇但顺序不同。
- 每个图像-描述语句对的设计使得词序变化导致视觉场景发生根本性改变,从而需要组合推理才能正确匹配。
- 该数据集由专家标注员手工整理,并附带细粒度标签,以支持对视觉与语言属性的详细性能分析。
- 在 Winoground 基准上评估了来自 11 种最先进视觉-语言模型的多样性模型,包括单流与双流架构。
- 模型性能通过三项指标进行衡量:文本得分(基于描述语句将描述匹配到正确图像)、图像得分(将图像匹配到正确描述语句)以及组得分(正确配对两组图像-描述语句)。
- 分析包括词-区域注意力热力图、描述语句困惑度、长度与模型得分之间的相关性研究,以及按模型架构、注意力机制类型和预训练数据规模的评估。

实验结果
研究问题
- RQ1视觉-语言模型在多大程度上能正确匹配包含相同词汇但顺序不同的描述语句?这一任务需要组合推理。
- RQ2尽管在标准视觉-语言基准上表现优异,为何最先进模型在此任务上表现如此严重失败?
- RQ3模型架构(单流 vs. 双流)、注意力机制和预训练数据规模在多大程度上影响模型在组合推理任务上的表现?
- RQ4模型行为中的主要失败模式是什么?它们与示例的语言和视觉复杂度有何相关性?
- RQ5模型表现能否通过语言属性(如描述语句困惑度或长度)预测?这些属性与人类表现有何关联?
主要发现
- 所有测试的视觉-语言模型在 Winoground 基准上的表现均显著优于随机猜测,组得分为接近 0%。
- ViLLA 的大尺寸检查点是唯一表现超过随机猜测的模型,但其优势仅为 0.00013 的置信度,表明改进微乎其微。
- 所有模型,包括采用交叉注意力机制的模型,在仅以词序为区分因素时均无法正确匹配图像与描述语句。
- 描述语句长度与模型表现之间存在显著负相关性,较长的描述语句导致得分更低,表明语言编码能力存在局限。
- 模型表现与描述语句困惑度相关性微弱,表明模型更可能为低困惑度描述语句赋予高分,但这种倾向并未转化为正确匹配。
- 更大的预训练数据集与更好的表现强相关,尤其在排除 CLIP 和 FLAVA 作为异常值后,表明规模是组合推理能力的关键因素。
![Figure 4 : Word-region alignment scores between the image and text features for ViLT [ 40 ] on examples from Winoground. In this case study, ViLT appears to disregard the information from adjectives. E.g., the heatmaps highlight the brown dog just as strongly regardless of whether the text was “brow](https://ar5iv.labs.arxiv.org/html/2204.03162/assets/images/vilt_ot_heatmap/e29_i0_base.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。