Skip to main content
QUICK REVIEW

[论文解读] SimNet: Enabling Robust Unknown Object Manipulation from Pure Synthetic Data via Stereo

Thomas Kollar, Michael Laskey|arXiv (Cornell University)|Jun 30, 2021
Robot Manipulation and Learning参考文献 39被引用 14
一句话总结

SimNet 是一种仅在低保真度合成立体图像数据上进行训练的多头神经网络,旨在实现对未知、光学特性复杂的物体(如透明或反光物体)在非结构化环境中的鲁棒感知与操作。通过利用可微分的立体匹配代价体积进行视差估计,并结合几何监督进行端到端训练,SimNet 在直接阳光照射下对高难度物体(如玻璃器皿)的抓取成功率高达 95%,显著优于仅使用 RGB-D 的基线方法(成功率仅 35%)。

ABSTRACT

Robot manipulation of unknown objects in unstructured environments is a challenging problem due to the variety of shapes, materials, arrangements and lighting conditions. Even with large-scale real-world data collection, robust perception and manipulation of transparent and reflective objects across various lighting conditions remain challenging. To address these challenges we propose an approach to performing sim-to-real transfer of robotic perception. The underlying model, SimNet, is trained as a single multi-headed neural network using simulated stereo data as input and simulated object segmentation masks, 3D oriented bounding boxes (OBBs), object keypoints, and disparity as output. A key component of SimNet is the incorporation of a learned stereo sub-network that predicts disparity. SimNet is evaluated on 2D car detection, unknown object detection, and deformable object keypoint detection and significantly outperforms a baseline that uses a structured light RGB-D sensor. By inferring grasp positions using the OBB and keypoint predictions, SimNet can be used to perform end-to-end manipulation of unknown objects in both easy and hard scenarios using our fleet of Toyota HSR robots in four home environments. In unknown object grasping experiments, the predictions from the baseline RGB-D network and SimNet enable successful grasps of most of the easy objects. However, the RGB-D baseline only grasps 35% of the hard (e.g., transparent) objects, while SimNet grasps 95%, suggesting that SimNet can enable robust manipulation of unknown objects, including transparent objects, in unknown environments.

研究动机与目标

  • 在无需大规模真实世界数据采集的前提下,实现机器人操作的模拟到真实世界的迁移。
  • 解决在光照条件变化下感知与操作未知、光学复杂物体(如透明或反光物体)的挑战。
  • 开发一种轻量级多任务网络,仅使用合成数据即可从立体图像中预测分割掩码、3D 方向包围框(OBBs)、关键点和视差。
  • 证明基于立体匹配的几何推理可在家庭等非结构化环境中实现鲁棒的感知与操作。
  • 在多样化的现实任务中验证该方法的有效性:包括汽车检测、T 恤折叠以及在复杂条件下对未知物体的抓取。

提出的方法

  • 非照片级真实感模拟器生成大规模、领域随机化的立体图像对,自动标注分割掩码、3D 方向包围框(OBBs)、物体关键点和视差。
  • SimNet 是一个单一的、轻量级的多头神经网络,端到端地在合成立体数据上进行训练,以预测分割掩码、OBBs、关键点和视差。
  • 使用可微分的立体匹配代价体积进行视差预测,使网络即使在低质量的合成场景中也能学习几何结构。
  • 通过深度重建辅助损失进行训练,以促使网络关注几何相关特征,从而提升模拟到真实世界的泛化能力。
  • 抓取位置通过预测的 OBBs 和关键点启发式推导得出,支持与经典运动规划器结合的端到端操作。
  • 在四个家庭环境中,使用丰田 HSR 机器人车队对方法进行真实世界任务评估,并与基于结构光传感的 RGB-D 基线方法进行对比。

实验结果

研究问题

  • RQ1仅在合成立体数据上进行训练的神经网络,能否在未知、光学挑战性强的物体感知与操作中实现鲁棒的模拟到真实世界迁移?
  • RQ2与主动式深度传感相比,学习到的立体匹配是否能提升在非结构化环境中(如直射阳光和非朗伯表面)的感知鲁棒性?
  • RQ3从立体图像中联合预测分割、OBBs、关键点和视差,是否能实现对未知物体的有效端到端操作?
  • RQ4在涉及透明和反光物体的抓取任务中,SimNet 的性能与基于 RGB-D 的基线方法相比如何?
  • RQ5从合成数据中学习的立体匹配在多大程度上能泛化到真实世界任务中,如 2D 汽车检测和可变形物体操作?

主要发现

  • 在未知物体抓取实验中,SimNet 对光学挑战性强的‘高难度’物体(如透明玻璃器皿)的抓取成功率达到 95%,而 RGB-D 基线方法仅达到 35%。
  • 在 T 恤折叠任务中,SimNet 显著优于 RGB-D 基线,关键点 mAP 达到 0.917,而 RGB-D 方法为 0.631,纯深度模型仅为 0.282。
  • 在 KITTI 2D 汽车检测基准上,SimNet 的 mAP 达到 0.826,优于单目(0.565)和堆叠立体基线(0.710),且仅比真实数据基线(0.861)低 3.5%。
  • 该网络在 Titan Xp GPU 上运行速度达 20Hz,展示了适用于机器人部署的实时推理能力。
  • 在直接自然阳光照射下,SimNet 的性能依然稳健,而主动式深度传感器则因红外干扰和噪声而性能下降。
  • 使用可微分立体匹配代价体积并结合几何监督,即使在低保真度合成数据上,也能实现有效的模拟到真实世界迁移,无需逼真渲染。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。