[论文解读] VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena
VALSE 是一个与任务无关的视觉-语言模型评估基准,通过六项结构化测试(存在性、复数、计数、空间关系、动作和回指)评估模型对语言现象的定位能力,使用精心设计的干扰项(foils)检测模型对语言细微差别的敏感度。尽管干扰项经过严格验证,当前模型表现依然较弱,凸显了在任务特定微调之外语言泛化能力的显著缺口。
We propose VALSE (Vision And Language Structured Evaluation), a novel benchmark designed for testing general-purpose pretrained vision and language (V&L) models for their visio-linguistic grounding capabilities on specific linguistic phenomena. VALSE offers a suite of six tests covering various linguistic constructs. Solving these requires models to ground linguistic phenomena in the visual modality, allowing more fine-grained evaluations than hitherto possible. We build VALSE using methods that support the construction of valid foils, and report results from evaluating five widely-used V&L models. Our experiments suggest that current models have considerable difficulty addressing most phenomena. Hence, we expect VALSE to serve as an important benchmark to measure future progress of pretrained V&L models from a linguistic perspective, complementing the canonical task-centred V&L evaluations.
研究动机与目标
- 为解决视觉-语言模型在任务特定基准之外对语言现象敏感度的细粒度评估不足问题。
- 开发一种诊断性基准,隔离语义数、词序和回指等语言结构,且不依赖任务特定标注。
- 通过结合自动方法(MLM、NLI)与人工验证及频率平衡,确保干扰项的有效性并最小化数据偏差。
- 提供一种与现有预训练模型兼容的零样本评估框架,避免重新训练。
- 建立一种可靠且资源消耗低的基准,用于衡量在多样化语言现象上的语言定位能力。
提出的方法
- VALSE 构建六个测试模块,每个模块聚焦一种特定的语言现象:存在性、复数、计数、空间关系、动作和回指。
- 针对每个测试,通过有针对性的语言修改生成干扰项——例如,使用否定处理存在性,用数字替换处理计数,或通过动作成分互换处理动作。
- 利用掩码语言建模(MLM)、自然语言蕴含(NLI)和人工标注对干扰项进行验证,确保语义合理性和语言正确性。
- 使用 Jensen-Shannon 散度平衡字词频率分布,防止统计偏差。
- 基准利用现有的图像字幕和 VQA 数据集(如 MSCOCO、Visual7W),以最小化标注成本并最大化数据质量。
- 评估采用零样本设置:模型在不重新训练的情况下,使用其标准预测头区分真实字幕与干扰项。
实验结果
研究问题
- RQ1预训练的视觉-语言模型在视觉语境中能多大程度检测到诸如语义数或词序等细微语言差异?
- RQ2当语言现象被操纵时,模型能否可靠地区分语义上合理的干扰项与真实字幕?
- RQ3不同干扰项生成策略(如 MLM、NLI、人工验证)如何影响基准的有效性与鲁棒性?
- RQ4即使在标准任务上表现良好,当前视觉-语言模型是否仍系统性地在语言现象定位上失败?
- RQ5字幕与干扰项之间的词频分布是否存在显著偏差,可能误导模型?
主要发现
- 当前视觉-语言模型在 VALSE 的全部六个测试模块中表现均较弱,表明其对语言现象的定位能力有限。
- 经人工验证后,字幕与干扰项之间的 Jensen-Shannon 散度保持稳定,证实统计偏差极小。
- 经人工验证的干扰项显著提升了基准的可靠性,标注者对干扰项合理性的判断一致性高。
- 仅依赖文本的模型(如掩码语言建模)在视觉干扰任务中表现欠佳,表明视觉定位并非可轻易习得。
- 使用 NLI 和 MLM 进行干扰项验证在过滤不合理的或语义不一致的干扰项方面表现有效。
- 总体而言,该基准表明,即使在提供视觉上下文的情况下,最先进模型在语言细微差别上仍存在困难,凸显了对更具语言敏感性的训练与评估的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。