[论文解读] Siamese Convolutional Neural Network for Sub-millimeter-accurate Camera Pose Estimation and Visual Servoing
本文提出一种孪生卷积神经网络,用于亚毫米级精度的相机位姿估计,实现了机器人装配任务中高精度视觉伺服控制。通过使用孪生架构估计图像对之间的相对位姿,网络在单次推理中将初始误差从10 mm/5°降低至0.6 mm/0.4°以下,实现了97.5%的VGA连接器插入成功率,且无需力觉传感。
Visual Servoing (VS), where images taken from a camera typically attached to the robot end-effector are used to guide the robot motions, is an important technique to tackle robotic tasks that require a high level of accuracy. We propose a new neural network, based on a Siamese architecture, for highly accurate camera pose estimation. This, in turn, can be used as a final refinement step following a coarse VS or, if applied in an iterative manner, as a standalone VS on its own. The key feature of our neural network is that it outputs the relative pose between any pair of images, and does so with sub-millimeter accuracy. We show that our network can reduce pose estimation errors to 0.6 mm in translation and 0.4 degrees in rotation, from initial errors of 10 mm / 5 degrees if applied once, or of several cm / tens of degrees if applied iteratively. The network can generalize to similar objects, is robust against changing lighting conditions, and to partial occlusions (when used iteratively). The high accuracy achieved enables tackling low-tolerance assembly tasks downstream: using our network, an industrial robot can achieve 97.5% success rate on a VGA-connector insertion task without any force sensing mechanism.
研究动机与目标
- 解决工业机器人装配任务中缺乏高精度、可泛化且鲁棒的视觉伺服方法的问题。
- 克服先前基于深度学习的视觉伺服方法的局限性,如泛化能力差、对光照敏感以及在真实数据上误差率较高。
- 开发一种位姿估计网络,即使在迭代应用于大初始位姿误差时,也能保持亚毫米级精度。
- 仅通过视觉反馈实现无需力觉传感的高精度机器人插入操作。
- 通过从相似训练样本中学习泛化能力,确保对新型连接器、部分遮挡和光照条件变化的鲁棒性。
提出的方法
- 采用具有两个相同、共享权重的特征提取器的孪生CNN架构,独立处理两个输入图像。
- 通过基于相关性的相似性模块,在后续层中比较每个图像的特征,以估计相对位姿差异。
- 在具有小位姿差异(≤10 mm平移,≤5°旋转)的合成图像对上进行训练,以学习细粒度的位姿回归。
- 位姿估计以一次完成的方式执行,预测将当前图像对齐到参考图像所需的变换。
- 对于大初始误差,网络以迭代方式应用,每次预测均逐步优化机器人的位姿直至收敛。
- 训练数据集通过机器人系统自动采集,该系统在受控且精确标注的位姿下捕获图像对。
实验结果
研究问题
- RQ1孪生CNN能否在机器人视觉伺服的相对相机位姿估计中实现亚毫米级精度?
- RQ2网络在未见于训练阶段的新型连接器上是否仍能保持高精度?
- RQ3在迭代使用时,网络对光照变化、部分遮挡和大初始位姿误差的鲁棒性如何?
- RQ4网络能否仅通过视觉反馈实现无需力觉传感的高精度机器人插入任务?
- RQ5当应用于远超出其训练分布的位姿差异时,网络性能是否仍能保持?
主要发现
- 网络在单次推理中将10 mm的平移初始误差和5°的旋转初始误差分别降低至0.6 mm和0.4°以下。
- 在迭代使用时,网络成功引导机器人从初始位姿误差达数厘米平移和数十度旋转的条件下,以亚毫米级精度到达目标位姿。
- 在真实世界VGA连接器插入任务中,模型实现了97.5%的成功率,且未使用任何力觉传感装置。
- 对于训练集中未包含的新型连接器(A2),网络在所有试验中实现了96%的成功率。
- 在光照条件变化、部分遮挡和图像噪声条件下,网络表现出鲁棒性,如在仅30%连接器可见的迭代插入试验中表现良好。
- 即使仅在小位姿差异上进行训练,网络在所有测试案例中(包括极端初始误差和遮挡情况)均能收敛至正确位姿。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。