Skip to main content
QUICK REVIEW

[论文解读] Learning 3D Dynamic Scene Representations for Robot Manipulation

Zhenjia Xu, Zhanpeng He|arXiv (Cornell University)|Nov 3, 2020
Human Pose and Action Recognition参考文献 39被引用 21
一句话总结

本文提出 DSR-Net,一种端到端的3D循环神经网络,可从深度观测中学习动态场景表征(DSR),捕捉物体恒常性、非模态完整性以及时空连续性。通过使用预测的场景流对特征图进行形变,DSR-Net 实现了空间上一致的视觉历史聚合,在3D场景动态预测任务中达到最先进性能,并实现了机器人操作任务(如平面推动)中的精确模型预测控制。

ABSTRACT

3D scene representation for robot manipulation should capture three key object properties: permanency -- objects that become occluded over time continue to exist; amodal completeness -- objects have 3D occupancy, even if only partial observations are available; spatiotemporal continuity -- the movement of each object is continuous over space and time. In this paper, we introduce 3D Dynamic Scene Representation (DSR), a 3D volumetric scene representation that simultaneously discovers, tracks, reconstructs objects, and predicts their dynamics while capturing all three properties. We further propose DSR-Net, which learns to aggregate visual observations over multiple interactions to gradually build and refine DSR. Our model achieves state-of-the-art performance in modeling 3D scene dynamics with DSR on both simulated and real data. Combined with model predictive control, DSR-Net enables accurate planning in downstream robotic manipulation tasks such as planar pushing. Video is available at https://youtu.be/GQjYG3nQJ80.

研究动机与目标

  • 解决2D和部分3D视觉预测模型在遮挡和杂乱环境中失效的局限性。
  • 开发一种3D场景表征,即使在物体被遮挡或仅部分观测时,也能保持物体身份和完整几何结构。
  • 实现在非结构化、动态场景中,机器人交互下刚体运动的长时序准确预测。
  • 将学习到的表征集成到模型预测控制中,以提升机器人操作规划性能。
  • 建立一个基准数据集,包含80k次仿真和1.5k次真实世界交互,用于评估动态3D场景表征。

提出的方法

  • 使用3D体素场景编码器将深度图像转换为截断符号距离场(TSDF),以实现3D场景表征。
  • 训练一个运动预测网络,从当前场景表征和机器人动作中估计体素化场景流。
  • 利用预测的场景流对场景表征进行空间形变,以对齐不同时序的特征,实现历史信息聚合。
  • 通过特征拼接和3D卷积操作,将形变后的当前表征与下一次观测的表征进行融合。
  • 在仿真环境中端到端训练整个 DSR-Net 框架,损失函数包括重建损失和运动预测损失。
  • 在真实世界数据上进行微调,并结合模型预测控制(MPC)在平面推动任务中进行动作规划。

实验结果

研究问题

  • RQ1在物体未被直接观测的情况下,3D场景表征能否在遮挡期间保持物体身份和几何结构?
  • RQ2学习时空连续性在动态多物体环境中的长时序运动预测中能提升多少性能?
  • RQ3基于运动预测的特征形变在空间上一致地聚合视觉历史方面有多高效?
  • RQ4学习到的3D动态场景表征能否提升机器人操作任务(如平面推动)中的动作规划性能?
  • RQ5在仿真和真实世界设置中,该方法与以往最先进模型相比表现如何?

主要发现

  • 在平面推动任务中,DSR-Net 在匹配目标构型时达到 0.72 的 IoU,显著优于 SE3-Net(0.31)和 SE3Pose-Net(0.32)。
  • 该模型在静态和动态遮挡期间均成功保持了物体身份并预测了运动,而 SingleStep 和 NoWarp 基线模型则未能做到。
  • DSR-Net 在仿真中实现了较高的无序 IoU(0.78)和有序 IoU(0.81),表明其具有鲁棒的时空连续性与一致的实例跟踪能力。
  • 消融实验表明,基于运动预测的形变显著提升了历史信息聚合效果,而使用真实形变(GTWarp)时性能甚至更高。
  • 该模型在真实世界设置中具有泛化能力,在配备桌面平面推动任务的 UR5 机器人平台上表现出一致的性能。
  • 所提出的包含 80k 次仿真和 1.5k 次真实世界交互的基准数据集,为动态3D场景表征的可靠评估提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。