Skip to main content
QUICK REVIEW

[论文解读] Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning

Weili Nie, Zhiding Yu|arXiv (Cornell University)|Oct 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 48被引用 20
一句话总结

本文提出了 Bongard-LOGO,一个由程序引导的 LOGO 语言生成的 12,000 个可由人类理解的视觉推理问题的新基准,用于建模人类水平的概念学习。结果表明,当前最先进深度学习模型在表现上与人类存在显著差距,揭示了在建模上下文依赖性、类比性和少样本视觉推理(具有无限词汇量)方面存在关键缺陷。

ABSTRACT

Humans have an inherent ability to learn novel concepts from only a few samples and generalize these concepts to different situations. Even though today's machine learning models excel with a plethora of training data on standard recognition tasks, a considerable gap exists between machine-level pattern recognition and human-level concept learning. To narrow this gap, the Bongard problems (BPs) were introduced as an inspirational challenge for visual cognition in intelligent systems. Despite new advances in representation learning and learning to learn, BPs remain a daunting challenge for modern AI. Inspired by the original one hundred BPs, we propose a new benchmark Bongard-LOGO for human-level concept learning and reasoning. We develop a program-guided generation technique to produce a large set of human-interpretable visual cognition problems in action-oriented LOGO language. Our benchmark captures three core properties of human cognition: 1) context-dependent perception, in which the same object may have disparate interpretations given different contexts; 2) analogy-making perception, in which some meaningful concepts are traded off for other meaningful concepts; and 3) perception with a few samples but infinite vocabulary. In experiments, we show that the state-of-the-art deep learning methods perform substantially worse than human subjects, implying that they fail to capture core human cognition properties. Finally, we discuss research directions towards a general architecture for visual reasoning to tackle this benchmark.

研究动机与目标

  • 为解决机器模式识别与人类水平视觉概念学习之间的长期差距,特别是在少样本、上下文依赖性和类比推理方面。
  • 开发一个可扩展、人类可解释的基准,以捕捉人类认知的核心特性,如上下文依赖性感知和无限词汇量泛化能力。
  • 通过创建一个强调组合性与抽象视觉推理、超越标准识别任务的基准,挑战现有深度学习模型。
  • 激发新型计算架构的发展,整合神经与符号推理,以实现稳健的视觉认知。
  • 提供一个标准化、大规模的数据集,适用于现代数据驱动方法,同时保留原始 Bongard 问题的认知复杂性。

提出的方法

  • 采用基于动作的 LOGO 语言进行程序引导生成,合成 12,000 个具有过程性图形序列的视觉可解释问题。
  • 围绕三种核心认知特性设计问题:上下文依赖性感知、类比构建感知以及具有无限词汇量的少样本学习。
  • 仅基于形状轮廓、类别和属性(例如凸性、对称性、三角形)定义概念,排除大小、方向和空间位置作为区分因素。
  • 将任务定义为少样本概念学习问题,模型需根据少数样本将测试图像分类为 A 组(正例)或 B 组(负例)。
  • 利用最先进的元学习和抽象推理算法,评估模型性能与人类受试者的对比。
  • 开展消融研究和失败模式分析,以识别当前基于学习方法的局限性,特别是在泛化能力和归纳偏置方面。

实验结果

研究问题

  • RQ1现代深度学习模型能否在需要上下文依赖性和类比感知的视觉推理任务中达到人类水平的表现?
  • RQ2当前的元学习和抽象推理模型在极少监督下对新型视觉概念的泛化能力如何?
  • RQ3在建模具有无限词汇量的人类类少样本视觉概念学习时,哪些归纳偏置是必不可少的?
  • RQ4深度学习模型在 Bongard 风格问题中的失败模式与人类推理模式有何不同?
  • RQ5混合神经符号架构是否能更好地捕捉人类视觉认知在该基准中的组合性与抽象性特征?

主要发现

  • 最先进的深度学习模型,包括元学习和抽象推理网络,在 Bongard-LOGO 基准上的表现显著逊于人类受试者。
  • 元学习方法优于其他方法,表明‘学会学习’的能力在少样本视觉推理的泛化中至关重要。
  • 不同元学习变体在不同任务中表现出特定优势,表明没有单一架构能普遍适用于所有概念类型。
  • 人类与机器之间的性能差距凸显了当前模型在捕捉上下文依赖性感知和类比推理方面的失败。
  • 消融研究显示,模型在抽象属性和关系概念上存在困难,尤其是在同一形状的解释因上下文改变时。
  • 该基准暴露了当前数据驱动方法的根本局限,特别是在建模视觉感知中的组合性与符号抽象方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。