Skip to main content
QUICK REVIEW

[论文解读] Systematic Visual Reasoning through Object-Centric Relational Abstraction

Taylor W. Webb, Shanka Subhra Mondal|arXiv (Cornell University)|Jun 4, 2023
Data Visualization and Analytics被引用 6
一句话总结

本文提出物体中心关系抽象(OCRA),一种将物体中心表征学习与关系抽象相结合的模型,以实现在视觉推理中的系统性泛化。通过提取物体槽、利用点积关系算子计算成对关系,并使用Transformer建模高阶模式,OCRA在复杂视觉任务上超越了强基线模型,包括一个新数据集(CLEVR-ART)中增强视觉复杂度的任务,展示了对未见过的物体配置的稳健零样本泛化能力。

ABSTRACT

Human visual reasoning is characterized by an ability to identify abstract patterns from only a small number of examples, and to systematically generalize those patterns to novel inputs. This capacity depends in large part on our ability to represent complex visual inputs in terms of both objects and relations. Recent work in computer vision has introduced models with the capacity to extract object-centric representations, leading to the ability to process multi-object visual inputs, but falling short of the systematic generalization displayed by human reasoning. Other recent models have employed inductive biases for relational abstraction to achieve systematic generalization of learned abstract rules, but have generally assumed the presence of object-focused inputs. Here, we combine these two approaches, introducing Object-Centric Relational Abstraction (OCRA), a model that extracts explicit representations of both objects and abstract relations, and achieves strong systematic generalization in tasks (including a novel dataset, CLEVR-ART, with greater visual complexity) involving complex visual displays.

研究动机与目标

  • 为解决视觉推理模型在少量示例学习后仍无法系统性泛化到新输入的缺陷。
  • 将物体中心表征学习与强归纳偏置的关系抽象相结合,以实现在视觉推理中类似人类的泛化能力。
  • 开发一种无需依赖预分割物体或真实标注的模型,以实现对复杂多物体视觉场景的推理。
  • 评估每个组件——物体槽、关系嵌入和高阶关系建模——对系统性泛化的必要性。
  • 证明模型在未见过的物体形状和配置下仍能有效泛化,即使在视觉扰动下也保持鲁棒性。

提出的方法

  • OCRA使用槽注意力从输入图像中提取K个物体中心潜在表征,每个表征包含因子化特征嵌入和位置嵌入。
  • 通过结合特征嵌入的点积和加法式位置嵌入的关系算子,计算成对关系嵌入。
  • 关系嵌入由Transformer编码器处理,以建模高阶关系结构并识别抽象规则。
  • 模型采用对比学习目标端到端训练,以鼓励解耦表征和关系抽象。
  • 提出一种新型数据集CLEVR-ART,其视觉复杂度更高,包含多样化的形状和空间排列,用于测试系统性泛化能力。
  • 消融研究评估了各组件的贡献,包括槽注意力、关系瓶颈、因子化表征以及用于高阶关系的Transformer。

实验结果

研究问题

  • RQ1能否通过联合学习物体中心表征与关系抽象,实现视觉推理任务中的系统性泛化?
  • RQ2关系瓶颈机制对零样本泛化到新物体配置有多关键?
  • RQ3将物体中心处理与关系抽象相结合,是否能提升复杂视觉推理任务的性能,优于先前方法?
  • RQ4架构组件如用于高阶关系的Transformer和点积关系算子,在泛化中起到多大作用?
  • RQ5在空间抖动或噪声等视觉变化下,模型表现如何,其泛化鲁棒性是否保持?

主要发现

  • 在m=95的泛化设置下,OCRA在RMTS任务上达到85.31% ± 2.0的测试准确率,显著优于消融模型。
  • 消融研究显示,移除槽注意力后性能降至56.58% ± 3.1,表明物体中心表征学习的必要性。
  • 无关系瓶颈的模型(w/o Relational Bottleneck)准确率仅为63.62% ± 1.0,证明关系抽象的重要性。
  • 将点积替换为外积后性能降至62.84% ± 1.6,表明点积的归纳偏置对关系泛化至关重要。
  • 移除用于高阶关系的Transformer(w/o Transformer)导致准确率下降至51.29% ± 0.2,确认建模复杂关系模式的必要性。
  • 使用学习型瓶颈替代点积的模型仅达到50.70% ± 0.4的准确率,表明点积的归纳偏置并非单纯压缩机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。