[论文解读] Segmenting Unknown 3D Objects from Real Depth Images using Mask R-CNN Trained on Synthetic Data
本文提出合成深度掩码 R-CNN(SD Mask R-CNN),一种仅在合成深度图像上进行训练的类别无关实例分割模型,结合领域随机化技术。该模型在真实世界深度图像上实现了最先进性能——相较于点云聚类基线模型,平均精度(AP)提升15%,平均召回率(AR)提升20%,并达到在真实数据上微调模型的性能水平,从而实现无需人工标注真实数据的鲁棒机器人抓取。
The ability to segment unknown objects in depth images has potential to enhance robot skills in grasping and object tracking. Recent computer vision research has demonstrated that Mask R-CNN can be trained to segment specific categories of objects in RGB images when massive hand-labeled datasets are available. As generating these datasets is time consuming, we instead train with synthetic depth images. Many robots now use depth sensors, and recent results suggest training on synthetic depth data can transfer successfully to the real world. We present a method for automated dataset generation and rapidly generate a synthetic training dataset of 50,000 depth images and 320,000 object masks using simulated heaps of 3D CAD models. We train a variant of Mask R-CNN with domain randomization on the generated dataset to perform category-agnostic instance segmentation without any hand-labeled data and we evaluate the trained network, which we refer to as Synthetic Depth (SD) Mask R-CNN, on a set of real, high-resolution depth images of challenging, densely-cluttered bins containing objects with highly-varied geometry. SD Mask R-CNN outperforms point cloud clustering baselines by an absolute 15% in Average Precision and 20% in Average Recall on COCO benchmarks, and achieves performance levels similar to a Mask R-CNN trained on a massive, hand-labeled RGB dataset and fine-tuned on real images from the experimental setup. We deploy the model in an instance-specific grasping pipeline to demonstrate its usefulness in a robotics application. Code, the synthetic training dataset, and supplementary material are available at https://bit.ly/2letCuE.
研究动机与目标
- 在无需人工标注真实训练数据的前提下,实现在真实深度图像上的类别无关实例分割。
- 解决为机器人感知任务构建手绘标注数据集所带来的高标注成本与可扩展性有限的问题。
- 开发一种能够从仿真良好泛化到现实世界杂乱场景(含遮挡与复杂几何结构)的方法。
- 展示合成数据结合领域随机化在真实世界机器人应用(如实例特定抓取)中的有效性。
提出的方法
- 作者使用模拟的3D CAD模型堆叠生成了包含50,000张深度图像和320,000个物体掩码的合成数据集。
- 在训练过程中应用领域随机化,通过随机变化相机位姿、内参参数及物体位置,以提升从仿真到现实的泛化能力。
- 在合成数据集(WISDOM-Sim)上训练一种掩码 R-CNN 的变体,实现无需真实数据或类别特定监督的实例分割。
- 在高分辨率真实世界数据集(WISDOM-Real)上评估该方法,该数据集包含密集杂乱的料箱及多样化物体几何形态。
- 将该方法集成至实例特定抓取流程中,利用预训练的 VGG-16 分类器从分割掩码中选择目标物体。
- 通过 COCO 指标和机器人抓取成功率,与点云聚类方法及在真实数据上微调的掩码 R-CNN 进行性能基准测试。
实验结果
研究问题
- RQ1仅在合成深度图像上进行训练的掩码 R-CNN 模型,能否在真实世界深度图像上实现高性能实例分割?
- RQ2领域随机化在基于深度的实例分割中如何提升从仿真到现实的泛化能力?
- RQ3在分割精度与机器人任务成功率方面,合成数据训练能否超越真实数据微调?
- RQ4该模型在低分辨率传感器和高度遮挡场景下的泛化能力如何?
- RQ5该模型能否在无需人工标注真实数据的前提下,实现有效的实例特定抓取?
主要发现
- 在 WISDOM-Sim 测试集上,SD Mask R-CNN 实现了 66.4% 的平均精度(AP)和 74.8% 的平均召回率(AR),显著优于欧几里得聚类(16.1% AP)和区域生长法(17.2% AP)。
- 在真实世界 WISDOM-Real 数据集上,SD Mask R-CNN 相较于点云聚类基线模型,平均精度提升15个百分点,平均召回率提升20个百分点。
- 该模型在低分辨率深度传感器上仍能保持优异性能,即使图像分辨率降低也表现稳健。
- 在实例特定抓取实验中,SD Mask R-CNN 达到 74% 的成功率,优于欧几里得聚类(56%),并达到在真实数据上微调的掩码 R-CNN 模型(78%)的性能水平。
- 在仅 1,000 张增强图像(由 100 张初始图像生成)上进行微调的分类器,训练时间不足两分钟,表明数据与训练开销极低。
- 该方法显著降低了对昂贵人工标注的依赖,实现了新机器人任务分割功能的快速部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。