Skip to main content
QUICK REVIEW

[论文解读] Hard to Cheat: A Turing Test based on Answering Questions about Images

Mateusz Malinowski, Mario Fritz|arXiv (Cornell University)|Jan 14, 2015
Multimodal Machine Learning Applications参考文献 11被引用 5
一句话总结

本文提出了一种基于图像问答的视觉图灵测试,作为评估多模态人工智能系统的稳健、整体性基准。通过限制答案空间并使用社会共识度量,减少了因过度解释而导致的作弊行为,实现了对视觉与语言模型在具身、开放式推理任务上的可扩展、自动化评估。

ABSTRACT

Progress in language and image understanding by machines has sparkled the interest of the research community in more open-ended, holistic tasks, and refueled an old AI dream of building intelligent machines. We discuss a few prominent challenges that characterize such holistic tasks and argue for "question answering about images" as a particular appealing instance of such a holistic task. In particular, we point out that it is a version of a Turing Test that is likely to be more robust to over-interpretations and contrast it with tasks like grounding and generation of descriptions. Finally, we discuss tools to measure progress in this field.

研究动机与目标

  • 为解决传统图灵测试的局限性,创建一种更稳健、基于感知的基准,用于人工智能评估。
  • 提出基于图像的问答作为整合视觉、语言与推理的综合性任务,最大限度减少过度解释和作弊行为。
  • 通过受限答案空间和社会共识度量,实现多模态模型的可扩展、自动化评估。
  • 建立一个基准,避免强制模型采用特定内部表征(与指摘、描述等任务不同)。
  • 通过提供可行的、众包获取数据的管道,推动视觉与语言理解的进展。

提出的方法

  • 使用受限答案空间以实现自动化评估,减少对每项预测进行人工标注的依赖。
  • 在词汇数据库上应用Wu-Palmer相似度(WUPS)来度量预测答案与真实答案之间的语义相似度。
  • 通过将模型输出与多个由人类标注的真实答案进行比较,实施社会共识评估以量化一致性。
  • 设计一项任务,要求模型回答关于图像的自然语言问题,需要联合理解视觉与语言信息。
  • 不强制要求特定内部表征(如目标检测、场景图),从而允许模型架构具有灵活性。
  • 引入两部分挑战:无辅助数据的子任务以测试泛化能力,以及允许使用外部资源的开放子任务。

实验结果

研究问题

  • RQ1如何设计一个视觉与语言基准,使其比传统图灵测试更不易受到过度解释和‘作弊’行为的影响?
  • RQ2哪些评估度量能够实现对多模态推理系统的可扩展、自动化且可靠的评估?
  • RQ3如何通过众包使视觉与语言任务的数据获取变得可行且可扩展?
  • RQ4在多大程度上能够从视觉数据中隐式获取常识知识,以及这种知识在多大程度上能提升问答性能?
  • RQ5在统一、综合的任务中,视觉感知、语言理解与推理之间的对齐面临哪些关键挑战?

主要发现

  • 基于图像问答的所提出的视觉图灵测试,相比传统图灵测试,更不容易因模糊或通用答案而被作弊。
  • 使用受限答案空间可在保持与人类判断高度一致的同时,实现自动化评估。
  • 通过多个真实答案的社会共识评估,为人工评估提供了一种实用且可扩展的近似方法。
  • 该任务允许灵活的模型架构,而无需强制采用目标检测器或场景图等内部表征。
  • 常识知识——尤其是关于物体功能的知识——显著提升了需要超越视觉特征进行推理的问题的性能。
  • 该基准支持数据受限的子任务以测试泛化能力,以及允许使用外部数据的开放子任务,从而支持多样化的评估场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。