Skip to main content
QUICK REVIEW

[论文解读] Solving Bongard Problems with a Visual Language and Pragmatic Reasoning

Stefan Depeweg, Constantin A. Rothkopf|arXiv (Cornell University)|Apr 12, 2018
Multimodal Machine Learning Applications参考文献 43被引用 16
一句话总结

本文提出了一种新颖的方法来解决邦加之谜问题,通过结合视觉特征提取与符号化视觉语言及实用推理。通过在形式化视觉语言上进行贝叶斯推断,系统从精心挑选的正负样本中推断出复杂概念,通过实用推理对示例选择进行解释,从而与邦加之谜的自身解答保持一致,实现了迄今为止最高的准确率。

ABSTRACT

More than 50 years ago Bongard introduced 100 visual concept learning problems as a testbed for intelligent vision systems. These problems are now known as Bongard problems. Although they are well known in the cognitive science and AI communities only moderate progress has been made towards building systems that can solve a substantial subset of them. In the system presented here, visual features are extracted through image processing and then translated into a symbolic visual vocabulary. We introduce a formal language that allows representing complex visual concepts based on this vocabulary. Using this language and Bayesian inference, complex visual concepts can be induced from the examples that are provided in each Bongard problem. Contrary to other concept learning problems the examples from which concepts are induced are not random in Bongard problems, instead they are carefully chosen to communicate the concept, hence requiring pragmatic reasoning. Taking pragmatic reasoning into account we find good agreement between the concepts with high posterior probability and the solutions formulated by Bongard himself. While this approach is far from solving all Bongard problems, it solves the biggest fraction yet.

研究动机与目标

  • 解决邦加之谜问题的挑战——即视觉概念学习任务,需要从极少的、非随机选择的样本中进行推理。
  • 通过从提取的图像特征构建形式化视觉语言,弥合亚符号视觉处理与符号推理之间的鸿沟。
  • 在概念归纳中引入实用推理,认识到邦加之谜中的示例是特意选择以传达目标概念。
  • 通过建模视觉特征及示例选择背后的交际意图,使性能超越以往系统,提升邦加之谜问题的解决能力。
  • 证明在结构化视觉语言上进行贝叶斯推断可产生与邦之自己表述高度一致的解答。

提出的方法

  • 使用图像处理技术(如检测形状、位置、大小和空间关系)从图像中提取视觉特征。
  • 使用一种能通过逻辑和空间关系表达复杂视觉概念的形式语言,将这些特征转换为符号化视觉词汇。
  • 基于贝叶斯推断构建概率模型,从给定的正负样本中归纳出最可能的概念。
  • 通过建模“示例是为最好传达目标概念而选择”的假设,将实用推理纳入其中,而非随机选择。
  • 使用马尔可夫链蒙特卡洛(MCMC)采样来探索可能概念的空间,并估计后验概率。
  • 通过将候选概念的后验概率与邦之原始解答进行比较,并考虑交际意图,对结果进行调整。

实验结果

研究问题

  • RQ1形式化视觉语言结合贝叶斯推断是否能有效建模邦加之谜中的复杂视觉概念?
  • RQ2在概念归纳中引入实用推理(即考虑示例的有意选择)在多大程度上提升了邦加之谜问题的性能?
  • RQ3符号化视觉推理在该任务中能在多大程度上超越纯粹的亚符号深度学习方法?
  • RQ4结构化表示与逻辑关系在使用极少数据解决视觉概念学习问题中起什么作用?
  • RQ5系统推断出的概念与邦之本人提供的原始解答在多大程度上一致?

主要发现

  • 通过利用形式化视觉语言和实用推理,该系统迄今在邦加之谜问题中实现了最高的解决比例。
  • 后验概率最高的概念与邦之本人的解答高度一致,表明与人类构建的概念具有强匹配性。
  • 对于邦加之谜第71题,系统将“左侧:存在二阶内部图形”识别为最可能的规则,后验概率为0.20。
  • 对于邦加之谜第79题,系统正确识别出“深色圆圈比三角形更靠近外轮廓圆”为关键区分特征,后验概率为0.12。
  • 实用推理的引入显著提升了性能,与非实用推理基线相比,与邦之原始解答的对齐度更高。
  • 该方法在处理复杂的空间和关系特征(如嵌套包含和相对距离)方面表现出鲁棒性,通过符号化组合实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。