[论文解读] Learning to reason over visual objects
本文提出了一种通用视觉推理模型——槽注意力评分网络(Slot Transformer Scoring Network, STSN),通过结合以对象为中心的槽注意力机制与Transformer推理模块,在多个类似RPM的基准测试中实现了最先进性能。通过利用无需任务特定归纳偏置的精确对象为中心表征,STSN实现了强大的泛化能力和抽象视觉推理能力,证明了以对象为中心的处理是此类任务的关键归纳偏置。
A core component of human intelligence is the ability to identify abstract patterns inherent in complex, high-dimensional perceptual data, as exemplified by visual reasoning tasks such as Raven's Progressive Matrices (RPM). Motivated by the goal of designing AI systems with this capacity, recent work has focused on evaluating whether neural networks can learn to solve RPM-like problems. Previous work has generally found that strong performance on these problems requires the incorporation of inductive biases that are specific to the RPM problem format, raising the question of whether such models might be more broadly useful. Here, we investigated the extent to which a general-purpose mechanism for processing visual scenes in terms of objects might help promote abstract visual reasoning. We found that a simple model, consisting only of an object-centric encoder and a transformer reasoning module, achieved state-of-the-art results on both of two challenging RPM-like benchmarks (PGM and I-RAVEN), as well as a novel benchmark with greater visual complexity (CLEVR-Matrices). These results suggest that an inductive bias for object-centric processing may be a key component of abstract visual reasoning, obviating the need for problem-specific inductive biases.
研究动机与目标
- 探究以对象为中心的视觉表征是否可作为抽象视觉推理的通用归纳偏置。
- 评估一种不具任务特定架构归纳偏置的模型是否能在类似RPM的推理任务中超越先前方法。
- 评估高质量重建损失在促进以对象为中心的编码与提升推理泛化能力方面的作用。
- 开发并评估一个新颖且更复杂的基准——CLEVR-Matrices,以在更高视觉复杂度下测试推理能力。
提出的方法
- 模型使用槽注意力从每张图像面板中提取K个对象槽,实现在无需真实分割标注情况下的以对象为中心编码。
- 将每张图像面板的槽与候选答案选项的槽拼接,形成序列输入至Transformer推理模块。
- Transformer为每个答案选项生成一个分数,最终预测通过这些分数的Softmax运算得出。
- 模型采用多任务目标进行训练:同时最小化任务损失(用于推理准确率)与重建损失(用于槽质量)。
- 对重建损失施加较高的权重(λ=1000),以确保高质量、对象特异的槽重建,这对性能至关重要。
- 该架构在三个基准上进行评估:PGM、I-RAVEN,以及一个视觉复杂度更高的新型CLEVR-Matrices数据集。

实验结果
研究问题
- RQ1仅使用以对象为中心的编码与Transformer架构的通用模型,是否能在抽象视觉推理任务中实现最先进性能?
- RQ2在不引入任务特定归纳偏置的前提下,以对象为中心的表征学习是否能提升视觉推理的泛化能力?
- RQ3基于槽的重建质量如何影响推理性能与泛化能力?
- RQ4以对象为中心的处理带来的性能增益是否在不同视觉复杂度的数据集上均保持稳健?
主要发现
- 在I-RAVEN基准上,STSN实现了95.7%的最先进测试准确率,优于此前未引入任务特定归纳偏置的方法。
- 在PGM基准上,STSN达到97.8%的准确率,展现出在标准RPM类任务上的强大性能。
- 在新颖且更复杂的CLEVR-Matrices基准上,STSN实现了最先进性能,证实其对更高视觉复杂度的鲁棒性。
- 消融实验表明,若移除槽注意力,准确率下降至71.0%,凸显其在性能中的核心作用。
- 当重建损失权重(λ)从1000降低至1时,推理准确率从95.7%降至74.2%,证实高质量重建对以对象为中心学习至关重要。
- 模型生成的槽特定重建结果与输入图像中的单个对象高度匹配,即使在无真实分割标注的情况下,也证实了有效的以对象为中心处理。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。