Skip to main content
QUICK REVIEW

[论文解读] O2O-Afford: Annotation-Free Large-Scale Object-Object Affordance Learning

Kaichun Mo, Yuzhe Qin|arXiv (Cornell University)|Jun 29, 2021
Robot Manipulation and Learning参考文献 53被引用 13
一句话总结

本文提出 O2O-Afford,一种大规模、无需标注的框架,通过物理仿真和一种新型的物体核点卷积网络来学习物体-物体功能。通过在 1,785 个 3D 形状上模拟四种任务(放置、适配、推动、堆叠)的交互,该框架在无任何人工标注的情况下生成每个点的功能热力图,实现了对未见过的形状和真实世界数据的强大泛化能力,在堆叠任务上的 F-score 最高达 91.7%。

ABSTRACT

Contrary to the vast literature in modeling, perceiving, and understanding agent-object (e.g., human-object, hand-object, robot-object) interaction in computer vision and robotics, very few past works have studied the task of object-object interaction, which also plays an important role in robotic manipulation and planning tasks. There is a rich space of object-object interaction scenarios in our daily life, such as placing an object on a messy tabletop, fitting an object inside a drawer, pushing an object using a tool, etc. In this paper, we propose a unified affordance learning framework to learn object-object interaction for various tasks. By constructing four object-object interaction task environments using physical simulation (SAPIEN) and thousands of ShapeNet models with rich geometric diversity, we are able to conduct large-scale object-object affordance learning without the need for human annotations or demonstrations. At the core of technical contribution, we propose an object-kernel point convolution network to reason about detailed interaction between two objects. Experiments on large-scale synthetic data and real-world data prove the effectiveness of the proposed approach. Please refer to the project webpage for code, data, video, and more materials: https://cs.stanford.edu/~kaichun/o2oafford

研究动机与目标

  • 解决机器人学与计算机视觉中物体-物体交互功能学习这一研究不足的问题。
  • 通过物理仿真和合成数据,实现在大规模下无需标注的物体-物体功能学习。
  • 将放置、适配、推动、堆叠等多种物体-物体交互任务统一到单一的逐点功能标注框架下。
  • 开发一种深度学习模型,使其在新形状、未见过的物体类别以及真实世界扫描数据上均具有泛化能力。
  • 通过编码几何与功能先验,减少机器人规划的搜索空间,以实现可行交互的建模。

提出的方法

  • 该框架使用 SAPIEN 物理仿真器,在 18 个类别的 1,785 个 ShapeNet 物体上生成数千个模拟的物体-物体交互场景。
  • 提出一种逐点功能标注任务,为场景点云中每个点分配一个成功完成任务的可能性得分。
  • 一种新型的物体核点卷积网络通过关注作用物体相对于每个场景点的形状和位姿,计算局部几何特征。
  • 网络在合成数据上端到端训练,使用二元交叉熵损失函数,并以 0.5 作为正负功能标签的阈值。
  • 该方法利用 ShapeNet 中的几何多样性,并模拟了碰撞、支撑和包含等真实的物理约束。
  • 通过零样本迁移至未见过的物体类别以及来自 iPad Pro 和 YCB 数据集的真实世界 3D 扫描数据,评估泛化性能。

实验结果

研究问题

  • RQ1是否可以在无需人工标注或示范的情况下,大规模学习物体-物体功能?
  • RQ2统一的深度学习框架是否能够泛化到包括放置、适配、推动和堆叠在内的多种物体-物体交互任务?
  • RQ3在存在噪声和部分几何缺失的真实世界 3D 扫描上,基于合成仿真训练的模型性能如何?
  • RQ4所学习的功能预测在多大程度上依赖于作用物体的尺寸和朝向?
  • RQ5该模型能否在单一统一表征中编码空间包含、支撑和碰撞规避等几何约束?

主要发现

  • 所提出的 O2O-Afford 框架在所有四项任务中均达到最先进性能,主评估中堆叠任务的 F-score 达 91.7%,放置任务达 90.0%。
  • 该方法在未见过的物体类别上也表现出有效泛化,零样本测试中堆叠任务的 F-score 为 89.6%,放置任务为 82.2%。
  • 消融实验表明,物体核点卷积网络至关重要,移除后各项任务的 F-score 均下降 6.0–8.0 个百分点。
  • 模型对物体尺寸和朝向表现出敏感性,当水杯尺寸超过抽屉容量时,能正确预测功能可能性降低。
  • 尽管仅在合成数据上训练,该模型在真实世界 3D 扫描上仍能生成有意义且可操作的功能热力图,适配任务的 AP 得分为 86.3%,推动任务为 46.9%。
  • 该框架能成功识别可行的交互区域,如放置任务中的平坦表面、适配任务中的合适槽位,同时避免与已有物体发生碰撞。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。