Skip to main content
QUICK REVIEW

[论文解读] PTR: A Benchmark for Part-based Conceptual, Relational, and Physical Reasoning

Yining Hong, Yi Li|arXiv (Cornell University)|Dec 9, 2021
Multimodal Machine Learning Applications被引用 15
一句话总结

本文提出了PTR,一个包含约70,000张RGBD合成图像的大规模基准数据集,提供详细的部件级注释,用于视觉推理。该研究评估了模型在五类推理任务——概念性、关系性、类比性、算术性和物理性推理——上的表现,结果表明,即使是最先进的模型在关系性和物理性推理方面与人类表现相比仍存在显著差距,凸显了在分层视觉理解方面存在的关键鸿沟。

ABSTRACT

A critical aspect of human visual perception is the ability to parse visual scenes into individual objects and further into object parts, forming part-whole hierarchies. Such composite structures could induce a rich set of semantic concepts and relations, thus playing an important role in the interpretation and organization of visual signals as well as for the generalization of visual perception and reasoning. However, existing visual reasoning benchmarks mostly focus on objects rather than parts. Visual reasoning based on the full part-whole hierarchy is much more challenging than object-centric reasoning due to finer-grained concepts, richer geometry relations, and more complex physics. Therefore, to better serve for part-based conceptual, relational and physical reasoning, we introduce a new large-scale diagnostic visual reasoning dataset named PTR. PTR contains around 70k RGBD synthetic images with ground truth object and part level annotations regarding semantic instance segmentation, color attributes, spatial and geometric relationships, and certain physical properties such as stability. These images are paired with 700k machine-generated questions covering various types of reasoning types, making them a good testbed for visual reasoning models. We examine several state-of-the-art visual reasoning models on this dataset and observe that they still make many surprising mistakes in situations where humans can easily infer the correct answer. We believe this dataset will open up new opportunities for part-based reasoning.

研究动机与目标

  • 为解决缺乏聚焦于基于部件的视觉推理,特别是超越物体级感知的分层部件-整体结构的基准问题。
  • 构建一个诊断性数据集,以捕捉细粒度的部件级属性、几何与空间关系,以及稳定性等物理属性。
  • 评估最先进视觉推理模型在利用共享部件(如腿、支撑结构)跨物体类别进行泛化能力方面的能力。
  • 探究当前模型在关系性和物理性推理方面的局限性,尤其是在复合物体结构上的推理表现。
  • 为开发能够像人类一样在部件、物体和物理约束之间进行分层推理的新模型提供基础。

提出的方法

  • 使用PartNet中的10,000个物体,合成约70,000张RGBD图像,涵盖五种类别:椅子、桌子、床、冰箱和手推车,具有丰富的几何与结构变化。
  • 为每张图像标注真实实例分割、语义标签、颜色属性、空间与几何关系(如平行、垂直),以及稳定性等物理属性。
  • 生成700,000个自然语言问题,涵盖五类推理类型:概念、关系、类比、算术和物理推理,每个问题均配对有可执行的功能程序。
  • 构建场景图以表示物体与部件之间的分层关系,支持对部件-整体组合的结构化推理。
  • 采用神经符号模型(NS-VQA)作为基线,该模型结合神经感知与符号推理,并在使用真实部件掩码和属性的消融设置下进行评估。
  • 通过在三个类别(椅子、冰箱、手推车)上训练并在全部五个类别上测试,开展跨类别泛化实验,以评估共享部件语义下的迁移能力。

实验结果

研究问题

  • RQ1当提供细粒度的部件级属性与关系时,视觉推理模型能否准确完成基于部件的概念性推理?
  • RQ2模型在多大程度上能通过利用共享部件结构(如腿、支撑)实现跨物体类别的泛化,以支持类比与关系推理?
  • RQ3模型在涉及稳定性与结构约束的物理推理任务中表现如何,这些约束源自部件几何与空间排列?
  • RQ4真实部件分割与属性监督对模型性能有何影响,尤其是在几何与物理推理方面?
  • RQ5当前最先进模型为何无法在基于部件的推理中达到人类水平表现?需要何种架构或训练改进?

主要发现

  • 所有评估的视觉推理模型,包括神经符号模型与多模态模型,在PTR上的表现均显著低于人类,尤其在关系性与物理性推理方面。
  • 神经符号模型(NS-VQA)在获得真实部件分割与属性的情况下,对概念性与算术性问题表现接近完美,但在几何与物理推理方面仍表现不佳。
  • 即使使用真实部件掩码,模型仍无法解决几何与物理问题,表明核心挑战在于对空间与物理约束的推理,而非感知本身。
  • 跨类别泛化能力有限:MAC(P)与LCGN等模型表现出较差的迁移性能,表明部件表征在类别间缺乏充分泛化能力。
  • 数据效率不等于泛化能力——LCGN在10%数据下表现良好,但无法在类别间泛化,表明数据效率不能作为分层推理能力的代理指标。
  • 模型与人类之间的性能差距依然巨大,尤其在物理与类比推理方面,表明当前模型缺乏对部件-整体层次结构与物理合理性的真正理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。