Skip to main content
QUICK REVIEW

[论文解读] 3D AffordanceNet: A Benchmark for Visual Object Affordance Understanding

Shengheng Deng, Xun Xu|arXiv (Cornell University)|Mar 30, 2021
Advanced Vision and Imaging参考文献 32被引用 4
一句话总结

该论文提出了3D AffordanceNet,一个包含22,949个3D形状、覆盖23种类别的大规模基准数据集,通过从稀疏关键点进行标签传播,对18种视觉功能类型进行标注。该数据集支持三种新型任务——完整形状、部分视角和旋转不变的功能估计,展示了基于点云网络的最先进性能,并表明半监督学习仅使用1%的标注数据即可显著提升结果。

ABSTRACT

The ability to understand the ways to interact with objects from visual cues, a.k.a. visual affordance, is essential to vision-guided robotic research. This involves categorizing, segmenting and reasoning of visual affordance. Relevant studies in 2D and 2.5D image domains have been made previously, however, a truly functional understanding of object affordance requires learning and prediction in the 3D physical domain, which is still absent in the community. In this work, we present a 3D AffordanceNet dataset, a benchmark of 23k shapes from 23 semantic object categories, annotated with 18 visual affordance categories. Based on this dataset, we provide three benchmarking tasks for evaluating visual affordance understanding, including full-shape, partial-view and rotation-invariant affordance estimations. Three state-of-the-art point cloud deep learning networks are evaluated on all tasks. In addition we also investigate a semi-supervised learning setup to explore the possibility to benefit from unlabeled data. Comprehensive results on our contributed dataset show the promise of visual affordance understanding as a valuable yet challenging benchmark.

研究动机与目标

  • 建立一个大规模、高质量的3D基准数据集,用于视觉功能理解,以解决现有2D和2.5D数据集中几何细节不足的问题。
  • 在23个语义物体类别上,使用从稀疏人工标注关键点推导出的概率性、逐点得分,定义并标注18种视觉功能类别。
  • 在真实3D点云数据上,提出并评估三种新型基准任务——完整形状、部分视角和旋转不变功能估计。
  • 在这些任务上评估最先进点云网络的性能,并探索半监督学习在降低标注成本方面的潜力。
  • 通过提供一个标准化、可扩展且逼真的基准,鼓励未来在3D视觉功能理解领域的研究。

提出的方法

  • 数据集源自PartNet 3D CAD数据集,包含来自23个语义类别的23,000多个形状,并对18种功能类型进行标注。
  • 通过在物体表面首先标注稀疏关键点,然后使用标签传播方法将标签传播到密集点云,生成功能标注。
  • 该基准支持三种评估任务:完整形状(完整形状作为输入)、部分视角(部分点云作为输入)和旋转不变(输入任意旋转)功能估计。
  • 使用标准指标(平均交并比(mIoU)、Dice系数和准确率)在所有任务上评估三种最先进点云网络(如DGCNN)。
  • 引入一种半监督学习设置,采用虚拟对抗训练(VAT),其中1%的数据被标注,其余作为无标签数据,以提升泛化能力。
  • 损失函数结合交叉熵损失、Dice损失以及原始输入与对抗扰动输入之间预测结果的均方误差,以在无标签数据上强制保持一致性。

实验结果

研究问题

  • RQ1一个具有概率性功能标注的大规模3D点云基准是否能提升视觉功能理解模型的评估与开发?
  • RQ2最先进点云网络在真实3D场景下的完整形状、部分视角和旋转不变功能估计任务中表现如何?
  • RQ3在仅使用极少标注数据的情况下,半监督学习在3D形状功能估计性能上的提升程度如何?
  • RQ4为何某些功能类别(如存储家具上的'contain'功能)在任意旋转下仍难以预测?
  • RQ5从稀疏人工标注中进行标签传播能否在大规模下生成可靠、密集的功能预测?

主要发现

  • 3D AffordanceNet基准包含56,307个定义明确的功能标注,覆盖22,949个3D形状,是首个在3D中具有概率性、逐点功能得分的大规模数据集。
  • 使用VAT的半监督功能估计在所有指标上均优于仅使用1%标注数据的完全监督训练,证明了无标签数据的价值。
  • 旋转不变任务仍极具挑战性,尤其对存储家具等复杂形状而言,由于凹形几何结构,'contain'功能常被遗漏。
  • 完整形状和部分视角任务在大多数功能类型上表现良好,但'open'和'pour'功能仍具挑战性,尤其当关键结构部分被遮挡时。
  • 从稀疏关键点进行标签传播可成功生成密集且高质量的功能标注,实现了可扩展且低成本的数据集构建。
  • 结果证实3D几何结构对功能理解至关重要,当前模型在细粒度、依赖上下文的交互方面仍存在困难。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。