Skip to main content
QUICK REVIEW

[论文解读] WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models

Yonatan Bitton, Nitzan Bitton Guetta|arXiv (Cornell University)|Jul 25, 2022
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出了 WinoGAViL,一个基于在线游戏的趣味化基准测试,灵感源自《猜谜王》(Codenames),用于收集对人工智能模型具有挑战性但对人类而言直观的视觉-语言关联。该框架收集了 3.5K 个实例,人类在这些实例上的 Jaccard 指数超过 90%,而表现最佳的模型(ViLT)仅达到 52%,凸显了视觉-语言模型在常识推理与联想推理方面仍需改进。

ABSTRACT

While vision-and-language models perform well on tasks such as visual question answering, they struggle when it comes to basic human commonsense reasoning skills. In this work, we introduce WinoGAViL: an online game of vision-and-language associations (e.g., between werewolves and a full moon), used as a dynamic evaluation benchmark. Inspired by the popular card game Codenames, a spymaster gives a textual cue related to several visual candidates, and another player tries to identify them. Human players are rewarded for creating associations that are challenging for a rival AI model but still solvable by other human players. We use the game to collect 3.5K instances, finding that they are intuitive for humans (>90% Jaccard index) but challenging for state-of-the-art AI models, where the best model (ViLT) achieves a score of 52%, succeeding mostly where the cue is visually salient. Our analysis as well as the feedback we collect from players indicate that the collected associations require diverse reasoning skills, including general knowledge, common sense, abstraction, and more. We release the dataset, the code and the interactive game, allowing future data collection that can be used to develop models with better association abilities.

研究动机与目标

  • 开发一种动态的、人机协同的基准测试,用于评估视觉-语言模型在物体识别之外的常识与联想推理能力。
  • 收集高质量、多样化的关联数据,这些数据依赖于通用知识、抽象思维与文化理解,而不仅仅是视觉显著性。
  • 通过游戏机制构建可扩展的数据收集框架,激励“间谍大师”生成对人工智能具有挑战性但对人类可解的提示。
  • 发布数据集、代码与交互式游戏,以支持未来在多模态常识推理方面的研究。

提出的方法

  • WinoGAViL 游戏框架采用‘间谍大师’角色,为一组图像生成文本提示,目标是让对手的 AI 模型困惑,但人类仍能正确识别。
  • 间谍大师的奖励基于 AI 模型(如 CLIP RN50)在该提示上的表现倒数,从而激励生成非平凡的关联。
  • 三名人类解谜者根据提示尝试识别正确图像,间谍大师的奖励基于人类表现,确保关联自然且直观。
  • 数据通过众包工作者使用游戏界面收集,共获得 3.5K 个实例,涵盖多个图像集与提示类型。
  • 基准测试使用 Jaccard 指数衡量性能,分数越高表示预测与真实图像选择的对齐程度越好。
  • 该框架与基于 SWOW(一种手工构建的文本关联资源)的基线进行对比,以证明趣味化数据在挑战 AI 模型方面的优越性。

实验结果

研究问题

  • RQ1趣味化数据收集框架能否生成对人类直观但对最先进 AI 模型具有挑战性的视觉-语言关联?
  • RQ2所收集的关联主要依赖于哪些类型的推理——常识、抽象思维、文化知识?
  • RQ3视觉-语言模型在 WinoGAViL 上的表现与在标准基准或其它数据收集方法上的表现相比如何?
  • RQ4模型在 WinoGAViL 上的失败在多大程度上源于视觉显著性不足,而非深层的常识推理缺陷?

主要发现

  • 人类在 WinoGAViL 基准测试上的表现超过 90% 的 Jaccard 指数,表明所收集的关联对人类高度直观。
  • 表现最佳的视觉-语言模型 ViLT 仅获得 52% 的 Jaccard 得分,表明该基准能有效挑战最先进模型。
  • 当提示具有视觉显著性时,模型表现最高,表明当前模型严重依赖视觉线索,而非深层语义或常识推理。
  • 趣味化数据收集方法生成的关联显著比基于 SWOW 的基线更具挑战性,后者为手工构建的文本关联资源。
  • 分析显示,98% 的间谍大师为同一图像集生成了不同的提示,表明关联生成具有高度多样性。
  • 数据集中 88% 的提示不包含未登录词,表明词汇覆盖度强,且数据收集过程中的噪声极少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。