Skip to main content
QUICK REVIEW

[论文解读] Visual Concept-Metaconcept Learning

Chi Han, Jiayuan Mao|arXiv (Cornell University)|Feb 4, 2020
Machine Learning in Bioinformatics被引用 21
一句话总结

本文提出视觉概念-元概念学习者(VCML),一种神经符号模型,能够从图像和问答对中联合学习视觉概念(例如,红色、立方体)与元概念(例如,'描述相同属性')。通过利用双向知识——使用元概念解决视觉模糊性,以及利用视觉定位推断未见概念对之间的关系——VCML 在低资源设置下实现了强大的泛化能力,并在概念与元概念泛化任务上优于基线模型。

ABSTRACT

Humans reason with concepts and metaconcepts: we recognize red and green from visual input; we also understand that they describe the same property of objects (i.e., the color). In this paper, we propose the visual concept-metaconcept learner (VCML) for joint learning of concepts and metaconcepts from images and associated question-answer pairs. The key is to exploit the bidirectional connection between visual concepts and metaconcepts. Visual representations provide grounding cues for predicting relations between unseen pairs of concepts. Knowing that red and green describe the same property of objects, we generalize to the fact that cube and sphere also describe the same property of objects, since they both categorize the shape of objects. Meanwhile, knowledge about metaconcepts empowers visual concept learning from limited, noisy, and even biased data. From just a few examples of purple cubes we can understand a new color purple, which resembles the hue of the cubes instead of the shape of them. Evaluation on both synthetic and real-world datasets validates our claims.

研究动机与目标

  • 为解决在有限、嘈杂或有偏见的数据下学习视觉概念的挑战,通过引入描述概念之间抽象关系的元概念。
  • 通过利用视觉定位作为线索,推断未见概念对之间的关系,从而提升元概念泛化能力。
  • 通过统一的神经符号框架与语言接口,弥合视觉概念学习与元概念学习之间的鸿沟。
  • 证明联合学习概念与元概念可提升视觉-语言推理中的数据效率与泛化能力。

提出的方法

  • VCML 使用视觉感知模块提取基于物体的图像表征。
  • 语义解析器将自然语言问题转化为用于推理的符号程序。
  • 神经符号程序执行器利用视觉特征评估符号程序以回答问题。
  • 通过使用配对的图像与问答数据,在潜在向量空间中联合训练概念嵌入与元概念算子。
  • 模型在两类问题上进行训练:视觉定位(例如,'有一个红色立方体吗?')与元概念关系(例如,'红色和绿色是否描述相同属性?')。
  • 双向知识流使元概念能够解决视觉模糊性(例如,区分'红色'是颜色还是形状),同时视觉概念能够预测新颖的元概念关系(例如,基于形状推断立方体与球体具有'相同属性')。

实验结果

研究问题

  • RQ1当训练数据有限或嘈杂时,元概念是否有助于解决概念学习中的视觉模糊性?
  • RQ2概念的视觉定位是否能够实现对未见概念对之间新颖元概念关系的泛化?
  • RQ3联合学习概念与元概念在多大程度上提升了视觉-语言推理中的数据效率?
  • RQ4在仅使用视觉与语言监督的情况下,模型在多大程度上能够预测未见概念对之间的元概念关系(例如,同义、上下位)?
  • RQ5在低资源视觉推理任务中,引入元概念是否能带来更好的性能表现?

主要发现

  • 在 CLEVR 数据集上,VCML 在同义元概念泛化任务中达到 100.0% 的准确率,优于所有基线模型。
  • 在相同类别(same_kind)元概念任务中,VCML 达到 99.3% 的准确率,显著优于次佳模型(92.3%)的性能。
  • 在仅使用 1K 个视觉定位问题的低资源设置下,VCML 通过利用元概念知识,提升了指代表达的准确率(Recall@1)。
  • 在 GQA 数据集上,VCML 在同义元概念任务中达到 91.1% 的准确率,而 BERT(变体 II)仅为 83.1%,显示出更优的泛化能力。
  • 在 CUB 数据集上,VCML 在上下位(hypernym)任务中达到 94.8% 的准确率,在整体关系(meronym)任务中达到 92.5%,在多数情况下优于 NS-CL 基线模型。
  • 随着训练数据量的增加,有与无元概念知识的模型之间的性能差距逐渐缩小,表明元概念在低数据场景下最具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。