Skip to main content
QUICK REVIEW

[论文解读] Binary Image Selection (BISON): Interpretable Evaluation of Visual Grounding.

Hexiang Hu, Ishan Misra|arXiv (Cornell University)|Jan 19, 2019
Multimodal Machine Learning Applications参考文献 45被引用 10
一句话总结

本文提出了二值图像选择(BISON),这是一种新颖的、可解释的视觉定位评估任务,要求系统从一对语义相似的图像中选择与字幕最相关的图像。BISON表明,尽管字幕生成模型在标准指标上的表现优于人类,但在细粒度视觉定位任务上仍与人类存在显著差距,凸显了当前模型在语言细微差别对齐方面的局限性。

ABSTRACT

Providing systems the ability to relate linguistic and visual content is one of the hallmarks of computer vision. Tasks such as image captioning and retrieval were designed to test this ability, but come with complex evaluation measures that gauge various other abilities and biases simultaneously. This paper presents an alternative evaluation task for visual-grounding systems: given a caption the system is asked to select the image that best matches the caption from a pair of semantically similar images. The system's accuracy on this Binary Image SelectiON (BISON) task is not only interpretable, but also measures the ability to relate fine-grained text content in the caption to visual content in the images. We gathered a BISON dataset that complements the COCO Captions dataset and used this dataset in auxiliary evaluations of captioning and caption-based retrieval systems. While captioning measures suggest visual grounding systems outperform humans, BISON shows that these systems are still far away from human performance.

研究动机与目标

  • 为解决视觉定位系统缺乏可解释的评估方法,以隔离细粒度语言-视觉对齐问题。
  • 识别现有评估指标的不足,这些指标混淆了视觉语言模型中的多种能力与偏差。
  • 提出一种简单但有效的二值图像选择任务,以隔离并衡量文本与视觉内容对齐的核心能力。
  • 通过实证评估表明,当前的字幕生成与检索模型在细粒度视觉定位任务上仍远未达到人类水平的性能。

提出的方法

  • BISON任务向系统提供一个字幕和两张语义相似的图像,要求其选择与字幕最匹配的图像。
  • 数据集通过将图像与在字幕内容相关方面存在细微语义差异的配对构建,以补充COCO字幕数据集。
  • 评估基于从配对中正确选择图像的准确率,提供一种直接且可解释的定位性能度量方式。
  • 该方法利用现有的字幕生成与检索模型在BISON基准上评估其性能,从而实现与人类表现的对比。
  • 通过确保图像对在外观上高度相似但仅在与字幕相关属性上存在差异,最小化混淆因素。
  • 评估框架支持对模型在特定语言和视觉差异上的行为进行细粒度分析。

实验结果

研究问题

  • RQ1最先进视觉定位模型在隔离细粒度语言-视觉对齐的二值图像选择任务上的表现如何?
  • RQ2与更具可解释性的、基于定位的评估相比,标准字幕生成与检索指标在多大程度上高估了模型性能?
  • RQ3BISON基准能否检测出在传统评估协议下被掩盖的模型与人类之间的性能差距?
  • RQ4当前模型在视觉定位任务中最难以解决的视觉与语言差异类型有哪些?

主要发现

  • BISON基准揭示,尽管在标准字幕生成指标上表现优于人类,视觉定位模型在细粒度图像选择任务上仍显著落后于人类。
  • 在COCO字幕上训练的模型在标准评估中表现优异,但在BISON任务中仅达到中等性能,表明标准指标与真实定位能力之间存在脱节。
  • 模型与人类在BISON任务上的性能差距显著,表明当前模型在捕捉字幕中细微语言差异方面仍缺乏稳健对齐。
  • BISON任务成功隔离并度量了核心视觉定位能力,暴露了在复杂、多维度评估指标下被掩盖的当前模型局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。