Skip to main content
QUICK REVIEW

[论文解读] Structure from Action: Learning Interactions for Articulated Object 3D Structure Discovery

Neil Nie, Samir Yitzhak Gadre|arXiv (Cornell University)|Jul 19, 2022
Human Pose and Action Recognition被引用 5
一句话总结

SfA 是一种框架,通过学习有信息量的 3D 交互并随时间聚合视觉观测,来发现 3D 机构化物体结构(包括部件几何、分割和关节参数)。该框架在仿真环境中进行训练,能够泛化到未见过的物体类别和真实世界物体,在未见类别上的 3D IoU 指标优于最先进方法 25.4 个百分点。

ABSTRACT

We introduce Structure from Action (SfA), a framework to discover 3D part geometry and joint parameters of unseen articulated objects via a sequence of inferred interactions. Our key insight is that 3D interaction and perception should be considered in conjunction to construct 3D articulated CAD models, especially for categories not seen during training. By selecting informative interactions, SfA discovers parts and reveals occluded surfaces, like the inside of a closed drawer. By aggregating visual observations in 3D, SfA accurately segments multiple parts, reconstructs part geometry, and infers all joint parameters in a canonical coordinate frame. Our experiments demonstrate that a SfA model trained in simulation can generalize to many unseen object categories with diverse structures and to real-world objects. Empirically, SfA outperforms a pipeline of state-of-the-art components by 25.4 3D IoU percentage points on unseen categories, while matching already performant joint estimation baselines.

研究动机与目标

  • 使机器人能够自主发现新型、未见过的机构化物体的 3D 机构化 CAD 模型,而无需事先具备特定类别的知识。
  • 解决通过有意图的 3D 交互恢复机构化物体中被遮挡的几何形状和关节构型的挑战。
  • 开发一个统一框架,将交互策略学习与动态 3D 感知相结合,实现持续的部件跟踪与重建。
  • 实现对真实世界物体和训练类别之外的多样化运动结构的零样本泛化。
  • 通过学习基于视觉反馈的自适应、有信息量的 3D 动作,克服被动感知和固定交互策略的局限性。

提出的方法

  • SfA 学习一种序列化的 3D 交互策略,通过选择动作来暴露隐藏部件并揭示运动约束(如关节类型和运动轴)。
  • 它采用一种动态 3D 部件重建模块,通过跨交互步骤聚合 RGB-D 观测,即使在被遮挡的情况下也能完成并分割部件。
  • 该框架使用联合估计模块,通过分析观测交互中的运动轨迹来推断关节参数(例如类型、轴线、运动范围)。
  • 采用标准坐标系来表示所有部件和关节,从而实现一致的 3D CAD 模型(例如 URDF)输出。
  • 系统完全在仿真环境中训练,使用可微分的感知与规划管道,实现零样本部署于真实世界机器人。
  • 历史聚合通过记忆增强网络学习,以在多个交互步骤中跟踪部件身份和几何形状。

实验结果

研究问题

  • RQ1单一智能体能否学会执行有信息量的 3D 交互,以暴露未见机构化物体中的隐藏几何形状和运动结构?
  • RQ2如何在 3D 空间中聚合来自序列交互的视觉观测,以重建完整且被遮挡的部件,并在时间上保持部件身份?
  • RQ3在仿真中训练的模型在多大程度上能泛化到具有新型运动结构和部件构型的真实世界机构化物体?
  • RQ4将 3D 交互学习与感知相结合,是否能比被动观测或 2D 动作空间带来更好的部件分割和关节估计?
  • RQ5与基于流水线的基线方法相比,交互与感知的整合在未见物体类别上的性能提升程度如何?

主要发现

  • SfA 在未见物体类别上的 3D IoU 指标比最先进组件的流水线高出 25.4 个百分点,证明了其强大的零样本泛化能力。
  • 在未见类别上,SfA 的交互策略比最接近的基线多获得 8 个最优动作点,表明其在 3D 空间中具有更优的策略学习能力。
  • SfA 可泛化至真实世界物体:使用仿真训练模型部署于 UR-5 机器人系统后,成功从 RGB-D 观测中发现部件和关节。
  • 该方法显著优于 2D 动作空间基线(如 AtP),后者因可视范围有限,尤其在遮挡部件上表现失败。
  • 历史聚合在新型运动结构(如眼镜)上的 mIoU 性能提升最高达 16 个百分点,且在多部件物体中提升最为显著。
  • 采用学习交互的 SfA 性能与使用真实动作的模型(SfA-Perception + GT-Act)相当,证明了交互策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。