Skip to main content
QUICK REVIEW

[论文解读] Learning Markerless Robot-Depth Camera Calibration and End-Effector Pose Estimation

Bugra C. Sefercik, Barış Akgün|arXiv (Cornell University)|Dec 15, 2022
Advanced Vision and Imaging被引用 4
一句话总结

该论文提出一种基于学习的无标记物方法,仅使用真实世界数据实现机械臂与深度相机之间的外部标定,避免使用仿真和标定标记。该方法结合了深度学习进行末端执行器分割、旋转预测和关键点检测,并通过ICP优化和多帧融合,实现了亚厘米级和亚度级的标定精度,仅需单个训练位姿即可达到高性能。

ABSTRACT

Traditional approaches to extrinsic calibration use fiducial markers and learning-based approaches rely heavily on simulation data. In this work, we present a learning-based markerless extrinsic calibration system that uses a depth camera and does not rely on simulation data. We learn models for end-effector (EE) segmentation, single-frame rotation prediction and keypoint detection, from automatically generated real-world data. We use a transformation trick to get EE pose estimates from rotation predictions and a matching algorithm to get EE pose estimates from keypoint predictions. We further utilize the iterative closest point algorithm, multiple-frames, filtering and outlier detection to increase calibration robustness. Our evaluations with training data from multiple camera poses and test data from previously unseen poses give sub-centimeter and sub-deciradian average calibration and pose estimation errors. We also show that a carefully selected single training pose gives comparable results.

研究动机与目标

  • 消除机器人-深度相机外部标定中对标定标记和仿真数据的依赖。
  • 实现自动化的真实世界数据采集与自监督标签生成以用于训练。
  • 仅使用深度数据和深度学习实现高精度末端执行器位姿估计与标定。
  • 开发一种鲁棒且可重复使用的标定系统,适用于动态或低成本机器人系统。

提出的方法

  • 系统使用基于MinkUNet18D的神经网络,从深度点云中进行末端执行器、机器人和背景的语义分割。
  • 通过一种变换技巧,利用旋转预测分支从旋转预测中推导出6-DoF位姿。
  • 关键点检测网络在末端执行器上识别3D特征点,位姿通过正交Procrustes分析(RPT)估计。
  • 通过迭代最近点(ICP)算法融合多帧位姿估计,以优化标定结果并降低噪声。
  • 应用异常值检测与过滤,以提升在多种相机位姿和环境条件下的鲁棒性。
  • 系统通过移动机器人至不同关节构型自动收集训练数据,仅在数据采集阶段使用初始标定结果。

实验结果

研究问题

  • RQ1无标记物、无仿真数据的系统能否实现机器人与深度相机之间高精度的外部标定?
  • RQ2仅使用真实世界数据(无合成数据)能否训练出在未见相机位姿下仍具有良好泛化能力的模型?
  • RQ3多帧ICP优化如何提升标定的鲁棒性与精度?
  • RQ4单个训练位姿在多大程度上可达到与多姿态训练相当的标定性能?
  • RQ5能否仅使用深度数据,通过联合学习实现高精度的末端执行器分割与位姿估计?

主要发现

  • 在多个测试位姿下,系统平均标定误差为0.74 cm和1.69°,即使在先前未见的相机配置下测试也表现良好。
  • 末端执行器位姿估计的平均误差为1.0 cm和2.74°,证明了实时位姿估计的高精度。
  • 仅使用一个精心选择的训练位姿即可实现与多姿态训练相当的标定性能,显著降低设置复杂度。
  • ICP算法显著提升了估计性能,使结果接近所用深度相机的物理极限。
  • 系统生成了高质量的机器人与末端执行器语义分割结果,支持下游感知任务。
  • 在初始标定准确且已考虑正向运动学误差的前提下,该方法对传感器噪声和机械误差具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。