Skip to main content
QUICK REVIEW

[论文解读] SegICP-DSR: Dense Semantic Scene Reconstruction and Registration

Jay Ming Wong, Syler Wagner|arXiv (Cornell University)|Nov 6, 2017
Robotics and Sensor-Based Localization参考文献 21被引用 5
一句话总结

SegICP-DSR 是一种实时、密集语义场景重建与位姿估计系统,通过将 RGB-D 数据融合为语义点云,采用视点特定的 CAD 模型射线投射,并应用密集语义 ElasticFusion 注册,实现了毫米级位姿精度(7.9 mm,σ=7.6 mm)和度级方向精度(1.7°,σ=0.7°),在非结构化环境中实现高精度机器人操作,位姿估计成功率达 97%,50 次中成功完成 48 次高精度插入任务。

ABSTRACT

To enable autonomous robotic manipulation in unstructured environments, we present SegICP-DSR, a real- time, dense, semantic scene reconstruction and pose estimation algorithm that achieves mm-level pose accuracy and standard deviation (7.9 mm, σ=7.6 mm and 1.7 deg, σ=0.7 deg) and suc- cessfully identified the object pose in 97% of test cases. This represents a 29% increase in accuracy, and a 14% increase in success rate compared to SegICP in cluttered, unstruc- tured environments. The performance increase of SegICP-DSR arises from (1) improved deep semantic segmentation under adversarial training, (2) precise automated calibration of the camera intrinsic and extrinsic parameters, (3) viewpoint specific ray-casting of the model geometry, and (4) dense semantic ElasticFusion point clouds for registration. We benchmark the performance of SegICP-DSR on thousands of pose-annotated video frames and demonstrate its accuracy and efficacy on two tight tolerance grasping and insertion tasks using a KUKA LBR iiwa robotic arm.

研究动机与目标

  • 解决在杂乱、非结构化环境中实现高精度机器人位姿估计的挑战。
  • 克服现有方法在约 1 cm 位姿误差处达到平台期的局限,该误差水平不足以满足如钉孔插入等高精度任务需求。
  • 实现实时、密集、语义化的场景重建,并实现准确、低方差的 6-DOF 物体位姿估计,以支持符号化任务规划与复杂操作。
  • 在 SegICP 的基础上进一步降低位姿估计误差并提高在具有挑战性的现实机器人任务中的成功率。

提出的方法

  • 使用 ElasticFusion 结合深度语义分割,将一系列 RGB-D 图像融合为密集的、语义标记的点云。
  • 采用视点特定的 CAD 模型射线投射,生成与当前观测几何结构匹配的候选点云。
  • 通过使用语义对应度量的迭代最近点(ICP)算法,执行模型到场景的配准步骤,将 CAD 模型与重建场景对齐。
  • 引入对抗训练以提升在复杂条件下的深度语义分割鲁棒性。
  • 自动化相机内参与外参的标定,以提升几何精度。
  • 利用重建点云输出的密集、平滑特性,降低帧间位姿估计的噪声与方差。

实验结果

研究问题

  • RQ1密集语义场景重建是否能显著提升在非结构化、杂乱环境中的 6-DOF 物体位姿估计精度?
  • RQ2与标准 ICP 方法相比,视点特定的 CAD 模型射线投射在多大程度上提升了配准精度?
  • RQ3将语义分割与密集重建相结合,如何降低位姿估计方差并提升高精度操作任务的成功率?
  • RQ4是否可以在不依赖闭环反馈的情况下实现实时、高精度位姿估计,从而支持在复杂场景中实现开环操作?
  • RQ5自动化相机标定与对抗训练对系统整体鲁棒性与精度有何影响?

主要发现

  • SegICP-DSR 实现了毫米级位置精度(平均 7.9 mm,σ=7.6 mm)和度级方向精度(平均 1.7°,σ=0.7°),相比 SegICP 提升了 29% 的精度。
  • 系统在数千帧视频中实现了 97% 的物体位姿识别成功率,较 SegICP 提高 14%。
  • 在高精度钉孔插入任务中,SegICP-DSR 成功完成 48/50 次插入,而 SegICP 仅完成 27/50 次,表现出显著性能提升。
  • 位姿估计方差大幅降低:欧氏距离标准差从 SegICP 的 4.37 mm 降至 SegICP-DSR 的 0.15 mm,欧拉角标准差从 1.42° 降至 0.03°。
  • SegICP-DSR 输出的密集、平滑点云本身即可有效降低位姿估计噪声,无需额外滤波,从而实现高度稳定的位姿估计。
  • 系统仅依赖位姿估计与逆运动学即可成功实现开环抓取与插入,20 次抓取中成功 17 次,应用于摩托车发动机盖操作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。