[论文解读] When are Lemons Purple? The Concept Association Bias of Vision-Language Models
本文识别并研究了CLIP中的概念关联偏差(CAB),即当图像中同时存在多个概念上关联的物体(如柠檬和茄子)时,该视觉-语言模型会错误地将属性(例如将'紫色'与'柠檬'关联)关联起来。这种偏差源于CLIP基于强烈的跨模态关联来填补缺失的概念,从而降低了在细粒度任务(如VQA)上的零样本性能。主要贡献在于证明CAB可预测VQA性能,并可通过添加微调后的Transformer头来增强模态交互,从而缓解该偏差。
Large-scale vision-language models such as CLIP have shown impressive performance on zero-shot image classification and image-to-text retrieval. However, such performance does not realize in tasks that require a finer-grained correspondence between vision and language, such as Visual Question Answering (VQA). As a potential cause of the difficulty of applying these models to VQA and similar tasks, we report an interesting phenomenon of vision-language models, which we call the Concept Association Bias (CAB). We find that models with CAB tend to treat input as a bag of concepts and attempt to fill in the other missing concept crossmodally, leading to an unexpected zero-shot prediction. We demonstrate CAB by showing that CLIP's zero-shot classification performance greatly suffers when there is a strong concept association between an object (e.g. eggplant) and an attribute (e.g. color purple). We also show that the strength of CAB predicts the performance on VQA. We observe that CAB is prevalent in vision-language models trained with contrastive losses, even when autoregressive losses are jointly employed. However, a model that solely relies on autoregressive loss seems to exhibit minimal or no signs of CAB.
研究动机与目标
- 调查CLIP为何在检索和分类任务上表现出强大的零样本性能,但在细粒度视觉-语言任务(如VQA)上表现不佳的原因。
- 识别并表征CLIP中一种新型偏差——概念关联偏差(CAB),即模型在被询问某一对象时,会基于该对象与其他对象之间的强跨模态关联,错误地填充其属性。
- 评估CAB对下游任务(如VQA和CLIPScore)的影响,揭示评估指标中出人意料的脆弱性。
- 证明通过增强模态交互来缓解CAB可提升VQA上的性能。
- 建立CAB严重程度与CLIP不同变体在下游VQA任务中准确率之间的定量关联。
提出的方法
- 作者设计了零样本图像分类和VQA风格的提示任务,以在受控的对象-属性共现条件下探测CLIP的属性预测行为。
- 他们引入CAB分数以量化偏差程度,衡量CLIP在被提示关于目标对象时,错误地预测与另一对象相关联的属性的频率。
- 他们通过在CLIP顶部添加一个额外的Transformer层进行微调,以实现更深层次的跨模态交互,从而降低CAB。
- 他们在VQA-v2数据集上评估性能,并分析多个模型变体中CAB分数与VQA准确率之间的相关性。
- 他们通过空间池化(例如图像左半部分)进行消融实验,以评估CLIP是否学习到局部化、以对象为中心的表征。
- 他们使用NCD(最近类均值)和UNCD(未归一化的NCD)进行零样本分类,以比较不同池化策略下的性能表现。
实验结果
研究问题
- RQ1为何CLIP尽管在零样本性能上表现强劲,却在细粒度视觉-语言任务(如VQA)上表现不佳?
- RQ2CLIP是否表现出一种偏差,即在被询问另一对象时,会错误地将一个对象的属性与之关联?
- RQ3对象-属性关联强度(例如柠檬-黄色与茄子-紫色)如何影响CLIP的预测行为?
- RQ4添加微调后的Transformer头是否能降低概念关联偏差并提升VQA性能?
- RQ5CAB严重程度与下游VQA性能之间是否存在定量关系?
主要发现
- 当图像中同时包含柠檬和茄子时,CLIP会以高置信度将'紫色'预测为柠檬的颜色,表现出强烈的概念关联偏差。
- 微调后的CLIP变体的CAB分数显著降低(0.330),相比冻结的CLIP(0.424),表明微调后偏差减少。
- 微调后CLIP模型在VQA-v2上的准确率为0.542,远高于冻结CLIP的0.390,表明偏差缓解后性能显著提升。
- CAB分数与VQA-v2准确率之间存在强烈负相关:CAB分数越低,VQA表现越好,如图16所示。
- 图像特征的空间池化(如图像左半部分)的准确率(0.209)低于全局池化(0.417),表明CLIP未学习到局部化、以对象为中心的表征。
- 由于CAB的存在,CLIPScore指标被发现具有脆弱性,因其易受强概念关联的影响而产生误导,引发对其评估可靠性的担忧。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。