Skip to main content
QUICK REVIEW

[论文解读] Flexible Compositional Learning of Structured Visual Concepts

Yanli Zhou, Brenden M. Lake|arXiv (Cornell University)|May 20, 2021
Multimodal Machine Learning Applications参考文献 22被引用 4
一句话总结

该论文提出了一种贝叶斯程序归纳模型,通过少量示例中的组合泛化,灵活学习结构化的视觉概念,使用思维的概率语言(probabilistic language of thought)来表示多样的关系结构。该模型在多种组合类型——固定构型、自由部件组合、方向约束和成对元素——上均能紧密拟合人类行为数据,展现出对方向不变性和灵活构型复用的强大归纳偏置。

ABSTRACT

Humans are highly efficient learners, with the ability to grasp the meaning of a new concept from just a few examples. Unlike popular computer vision systems, humans can flexibly leverage the compositional structure of the visual world, understanding new concepts as combinations of existing concepts. In the current paper, we study how people learn different types of visual compositions, using abstract visual forms with rich relational structure. We find that people can make meaningful compositional generalizations from just a few examples in a variety of scenarios, and we develop a Bayesian program induction model that provides a close fit to the behavioral data. Unlike past work examining special cases of compositionality, our work shows how a single computational approach can account for many distinct types of compositional generalization.

研究动机与目标

  • 研究人类在少样本学习场景下,如何对多样化的视觉组合类型进行泛化。
  • 开发一个统一的计算模型,以解释多种组合泛化形式,包括固定构型、自由部件组合、方向约束和成对元素。
  • 评估单一贝叶斯程序归纳框架在在多类组合泛化中是否能捕捉人类视觉概念学习中的丰富归纳偏置。

提出的方法

  • 本研究使用概率思维语言(PLoT)定义抽象外星人形象的生成程序空间,编码部件、关系和空间构型。
  • 采用贝叶斯推理框架,基于观察到的示例对程序进行后验概率评分,优先选择在组合结构先验下最能解释数据的程序。
  • 模型采用两种关键语法操作:'attach'用于生成两个部件的所有可能构型,'attach*'用于指定单一目标构型。
  • 通过最大后验估计(MAP)将模型拟合到行为数据,自由参数捕捉人类的归纳偏置,如方向不变性和构型灵活性。
  • 该框架支持新概念的生成采样,实现与人类生成示例的比较,并在生成任务上评估模型性能。
  • 通过与基于字符串的模型和预训练CNN等替代模型进行比较,以隔离组合结构和关系推理的作用。

实验结果

研究问题

  • RQ1人类能否仅凭少数示例,对多种视觉概念类型(如固定构型、自由组合、方向约束、成对元素)进行有意义的组合泛化?
  • RQ2人类的归纳偏置(如方向不变性和对新构型的容忍度)在少样本设置下如何塑造其概念学习行为?
  • RQ3单一贝叶斯程序归纳模型在多类组合泛化中,能在多大程度上解释视觉学习中的多种泛化类型?

主要发现

  • 贝叶斯程序归纳模型在所有测试的概念类型上均与人类泛化模式高度吻合,显著优于基线模型(如字符串-GCM和预训练CNN)。
  • 参与者表现出对方向不变性概念的强烈偏好,这在模型语法中方向不变性概率的高MAP估计中得到体现。
  • 人类在泛化时表现出灵活性,能够超越已观察到的构型,表明其倾向于使用可复用的抽象关系规则,而非刚性记忆特定布局。
  • 模型在泛化到新构型和未见基元方面的能力,凸显其捕捉高层次组合抽象(如部件重复和关系约束)的能力。
  • 拟合后的模型参数揭示了具有心理学意义的归纳偏置,包括对无需固定构型的概念的偏好,表明存在强烈的组合泛化偏置。
  • 该框架实现了人类与模型在判别和生成任务上的直接比较,为将人类般的归纳偏置融入神经网络模型提供了可行路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。