[论文解读] Probing Image-Language Transformers for Verb Understanding
本文提出了 SVO-Probes,一个包含 48,000 对图像-句子配对的基准,其中 subject、verb 和 object 的否定样本受到控制,用于评估图像-语言转换器对动词的理解能力。尽管在下游任务中表现强劲,模型在动词不匹配的情况下表现最差,即使对于语义上不相关的配对也过度预测匹配,且在噪声较多的 Conceptual Captions 预训练数据上的表现不如在更干净的 MSCOCO 数据上的表现,凸显了在动词层面多模态理解方面存在关键差距。
Multimodal image-language transformers have achieved impressive results on a variety of tasks that rely on fine-tuning (e.g., visual question answering and image retrieval). We are interested in shedding light on the quality of their pretrained representations -- in particular, if these models can distinguish different types of verbs or if they rely solely on nouns in a given sentence. To do so, we collect a dataset of image-sentence pairs (in English) consisting of 421 verbs that are either visual or commonly found in the pretraining data (i.e., the Conceptual Captions dataset). We use this dataset to evaluate pretrained image-language transformers and find that they fail more in situations that require verb understanding compared to other parts of speech. We also investigate what category of verbs are particularly challenging.
研究动机与目标
- 探究图像-语言转换器是否能够在多模态情境中区分细微的语言差异,尤其是动词。
- 评估模型是否依赖语言先验,还是真正理解动词与图像之间的语义关系。
- 比较预训练数据质量(噪声大 vs. 清晰)对视觉-语言模型中动词理解的影响。
- 识别当前模型最难处理的动词类别。
提出的方法
- 构建了一个新的基准 SVO-Probes,包含 48,100 对图像-句子配对,对 subject、verb 和 object 进行标注,并包含受控的否定样本,其中仅一个元素(subject、verb 或 object)不同。
- 设计图像-句子配对,使得每个否定样本仅在一个方面(例如 verb)上不同,从而能够精确探测模型的理解能力。
- 在零样本设置下,使用预训练权重评估多种图像-语言转换器架构(如 MMT)对图像-句子配对匹配的分类能力。
- 对比在两个预训练数据集上微调的模型:噪声较大的 Conceptual Captions(300 万对)和更干净、人工标注的 MSCOCO(12 万对)。
- 通过分析 subject、verb 和 object 否定样本的分类准确率,进行消融研究,以隔离性能差异。
- 通过测量 147 个高频动词(每个动词至少有 30 个否定样本)的否定对准确率,识别出困难和简单的动词。
实验结果
研究问题
- RQ1图像-语言转换器能否准确区分仅在动词上不同的图像-句子配对,从而表明其具备真正的动词理解能力?
- RQ2与较小但更清晰的数据集(MSCOCO)相比,在更大但更嘈杂的数据集(Conceptual Captions)上预训练是否会导致动词理解能力下降?
- RQ3模型是否更容易对语义相关但不正确的图像-句子配对过度预测匹配,尤其是在动词错误的情况下?
- RQ4哪些动词类别最难被模型区分,其哪些特性使其具有挑战性?
- RQ5在现有数据集中被标记为‘视觉性’的动词(如 imSitu 中的)在此基准上是否表现更好?
主要发现
- 图像-语言转换器在与动词相关的否定样本上表现最差,否定对准确率仅为 39.5%,显著低于 subject(52.4%)和 object(73.4%)。
- 在 Conceptual Captions(CC)上训练的模型在 SVO-Probes 上的整体准确率为 64.3%,而在 MSCOCO 上训练的模型为 68.0%,尽管 MSCOCO 数据集更小且多样性更低。
- 在 MSCOCO 上训练的 MMT 模型在否定对分类任务上优于在 CC 上预训练的模型,尤其是在动词方面,表明更干净的数据能提升模型对语义不匹配的敏感性。
- 模型会过度预测语义上松散相关但不匹配的图像-句子配对,表明其倾向于将语义上可能的配对关联起来,即使动词不匹配。
- 像 'cut'、'argue' 和 'break' 这类动词是最难正确分类的,而 'tackle'、'lead' 和 'surround' 则更容易,表明语义和感知复杂性会影响模型性能。
- 与预期相反,在 imSitu 数据集中被标记为‘视觉性’的动词在本基准上比非视觉性动词更难分类,表明视觉性本身并不能预测模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。