[论文解读] Probabilistic 3D Multilabel Real-time Mapping for Multi-object Manipulation
本文提出了一种实时概率3D多标签映射方法,将octomap扩展以在每个体素中同时表示多个物体标签和碰撞占据信息,从而实现从多视角RGB-D数据进行密集的多物体3D分割。在严重遮挡条件下,该方法在多物体任务中实现了86.9%的识别率和60.7%的成功操作率,相较于基于投影的方法,平均$IU_{3d}$提升了40–96%。
Probabilistic 3D map has been applied to object segmentation with multiple camera viewpoints, however, conventional methods lack of real-time efficiency and functionality of multilabel object mapping. In this paper, we propose a method to generate three-dimensional map with multilabel occupancy in real-time. Extending our previous work in which only target label occupancy is mapped, we achieve multilabel object segmentation in a single looking around action. We evaluate our method by testing segmentation accuracy with 39 different objects, and applying it to a manipulation task of multiple objects in the experiments. Our mapping-based method outperforms the conventional projection-based method by 40 - 96\% relative (12.6 mean $IU_{3d}$), and robot successfully recognizes (86.9\%) and manipulates multiple objects (60.7\%) in an environment with heavy occlusions.
研究动机与目标
- 为解决杂乱、遮挡环境中实时、多标签3D物体分割的缺失问题。
- 将单标签概率映射扩展为在单一体素网格中同时支持多个物体标签。
- 实现在严重遮挡条件下实时、密集的3D分割与多物体操作。
- 评估该方法在分割精度与真实世界操作任务中的性能表现。
提出的方法
- 扩展octomap以在每个体素中存储多标签占据概率,实现对多个物体标签与碰撞信息的并行表示。
- 采用两阶段系统:首先通过深度学习进行2D实例分割,生成每类别的概率图;随后通过体素级标签概率更新实现3D映射。
- 利用RGB-D相机标定将2D概率图投影到3D点,通过单一八叉树结构在多个视角间累积概率。
- 应用贝叶斯更新机制,随时间动态维护并优化每个体素中的多标签占据概率。
- 以每个体素中最大标签概率确定最终物体标签分配,并设定占据阈值。
- 将地图集成至机器人操作流程中,实现顺序物体识别、遮挡物移除及目标抓取。
实验结果
研究问题
- RQ1能否从多视角RGB-D数据构建实时3D多标签占据地图,以支持密集的多物体分割?
- RQ2在遮挡环境中,多标签3D映射相较于2.5D投影方法在分割精度上提升多少?
- RQ3该方法在严重遮挡条件下能多大程度上实现成功的多物体操作?
- RQ4该系统在涉及识别、障碍物清除与目标抓取的真实世界操作任务中表现如何?
主要发现
- 所提方法实现了12.6的平均$IU_{3d}$,相较于基于投影的方法相对提升40–96%。
- 在多物体操作任务中,机器人在86.9%的试验中成功识别目标与非目标物体。
- 系统在完成完整抓取任务(包括障碍物清除与目标抓取)中的成功率达到60.7%。
- 该方法在存在自遮挡与物体间遮挡的环境中表现出鲁棒性,优于单视角投影方法。
- 失败案例主要源于夹爪漏气(抓取失败)或在识别阶段对非目标物体的误分类。
- 该方法实现了实时性能,可在单次多视角观测周期内完成完整的3D分割与操作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。