[论文解读] Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images
本文介绍了 WHOOPS!,一个包含500张通过文本到图像模型(如 Midjourney)生成的合成图像的视觉-语言基准,这些图像违背常识。该研究在四个任务上评估了最先进模型的表现,包括解释生成,揭示了人类(95% 准确率)与模型如 BLIP2-XXL(27%)和 GPT-3(33%)之间存在显著性能差距,凸显了提升人工智能视觉常识推理能力的迫切需求。
Weird, unusual, and uncanny images pique the curiosity of observers because they challenge commonsense. For example, an image released during the 2022 world cup depicts the famous soccer stars Lionel Messi and Cristiano Ronaldo playing chess, which playfully violates our expectation that their competition should occur on the football field. Humans can easily recognize and interpret these unconventional images, but can AI models do the same? We introduce WHOOPS!, a new dataset and benchmark for visual commonsense. The dataset is comprised of purposefully commonsense-defying images created by designers using publicly-available image generation tools like Midjourney. We consider several tasks posed over the dataset. In addition to image captioning, cross-modal matching, and visual question answering, we introduce a difficult explanation generation task, where models must identify and explain why a given image is unusual. Our results show that state-of-the-art models such as GPT3 and BLIP2 still lag behind human performance on WHOOPS!. We hope our dataset will inspire the development of AI models with stronger visual commonsense reasoning abilities. Data, models and code are available at the project website: whoops-benchmark.github.io
研究动机与目标
- 开发一个超越物体识别的基准,以挑战人工智能模型的视觉常识推理能力。
- 创建一个多样化、合成的图像数据集,其中图像违背物理、时间、生物或文化规范。
- 在新颖任务(尤其是解释生成)上评估最先进视觉-语言模型,以揭示当前的局限性。
- 提供公开可访问的数据集、代码和排行榜,以支持视觉常识推理的系统性评估与进展。
提出的方法
- 与设计师合作,利用文本到图像模型(如 Midjourney、DALL-E、Stable Diffusion)生成500张不寻常的图像,通过修改合理场景来制造常识违背。
- 为每张图像标注了其异常的原因(详细解释)、描述性图像描述、不明确的图像描述以及视觉问题-答案对。
- 设计了四个基准任务:(1) 解释生成,(2) 图像描述,(3) 详细描述与不明确描述之间的跨模态匹配,(4) 视觉问答。
- 引入基于 GPT-4 的自动评估指标用于解释生成,其与人类评分的一致性达到81%准确率。
- 对 BLIP2-XXL、OFA、CoCa 和 GPT-3 流水线等模型进行了零样本和有监督评估,同时对比合成图像与自然图像的表现。
- 收集了(自然、正常、异常)图像三元组的对比集,以隔离图像合成与图像本身“异常性”及组合不一致对模型性能的影响。
实验结果
研究问题
- RQ1最先进视觉-语言模型能否为图像违背常识的原因生成合理解释?
- RQ2模型在异常图像上的解释生成表现与人类表现相比如何?
- RQ3WHOOPS! 的难度源于图像生成过程,还是源于图像本身固有的异常性与组合不一致性?
- RQ4在各类常识违背中(如时间、生物、物理等),哪一类对当前模型最具挑战性?
- RQ5用于解释生成的自动化评估指标能否可靠地反映人类判断?
主要发现
- 人类在解释生成任务上的表现达到95%,而表现最好的模型(微调后的 BLIP2-XXL)仅达到27%的可接受度,表明视觉常识推理方面存在显著差距。
- 基于 GPT-4 的解释生成自动评估指标在与人类评分对齐方面达到81%准确率,使可靠的自动化基准测试成为可能。
- 即使提供真实图像描述(即“神谕”输入),模型在解释异常性方面的准确率也仅达到68%,证明挑战在于推理能力,而非图像描述能力。
- 模型表现因常识类别而异:BLIP2-XXL 和 GPT-3 流水线在时间错位和艺术知识违背方面表现最差。
- 图像描述准确率从自然和正常图像的89%下降到异常图像的49%,证实主要挑战来自“异常性”而非图像生成过程。
- 在46%的常识类别中,使用 GPT-3 对预测图像描述进行后处理的流水线方法优于端到端的 BLIP2-XXL,表明大型语言模型在获得中间输出引导时,能更有效地推理视觉不一致现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。