[论文解读] 3D Robot Pose Estimation from 2D Images
本文提出了一种端到端的深度学习框架,用于从单张2D图像进行3D机器人位姿估计,通过分阶段的CNN和循环分割网络联合预测关节位置、稀疏深度图以及实例掩码。尽管仅在非真实的合成数据上进行训练,该方法在真实世界图像上仍表现出良好的泛化能力,深度估计的平均像素误差分别为5.81 cm(近程)和9.50 cm(远程)。
This paper considers the task of locating articulated poses of multiple robots in images. Our approach simultaneously infers the number of robots in a scene, identifies joint locations and estimates sparse depth maps around joint locations. The proposed method applies staged convolutional feature detectors to 2D image inputs and computes robot instance masks using a recurrent network architecture. In addition, regression maps of most likely joint locations in pixel coordinates together with depth information are computed. Compositing 3D robot joint kinematics is accomplished by applying masks to joint readout maps. Our end-to-end formulation is in contrast to previous work in which the composition of robot joints into kinematics is performed in a separate post-processing step. Despite the fact that our models are trained on artificial data, we demonstrate generalizability to real world images.
研究动机与目标
- 解决真实工业环境中缺乏大规模、带标注的数据集以支持机器人位姿估计的问题。
- 实现在无需3D深度传感器或人工标注的情况下,仅通过单目2D图像准确重建3D运动链。
- 开发一种能够从合成仿真数据泛化到真实世界图像的方法,避免高昂的数据采集与标注成本。
- 以端到端的方式联合估计机器人实例分割、2D关节位置和稀疏深度图。
- 证明基于仿真训练的模型可在真实世界的机器人位姿估计任务中实现稳健性能。
提出的方法
- 该方法使用分阶段的卷积神经网络,从单张2D RGB图像中预测关节位置和稀疏深度图的置信度图。
- 一个循环实例分割网络处理置信度图和深度图,生成机器人实例掩码,避免了对关节进行复杂的事后分组。
- 通过在置信度图上应用非极大值抑制来识别关节位置,并利用深度值进行重投影以重建3D坐标。
- 模型仅使用人工渲染的3D仿真数据进行训练,并采用领域随机化以增强泛化能力。
- 利用实例掩码对每个机器人组合关节置信度图和深度图,从而实现运动链重建。
- 该流程将关节检测、深度回归和实例分割整合到一个统一的端到端框架中,消除了独立的事后处理步骤。
实验结果
研究问题
- RQ1仅在合成3D渲染数据上训练的深度学习模型,能否在真实世界图像上实现准确的3D机器人位姿估计?
- RQ2联合预测2D关节位置、深度和实例分割在重建完整3D运动链方面的有效性如何?
- RQ3与传统的关节事后分组方法相比,使用循环实例分割网络在性能提升方面有多大改善?
- RQ4在外观和姿态多样的真实世界机器人图像上测试时,基于仿真训练的模型具有怎样的泛化能力?
- RQ5当场景中机器人实例数量增加时,该流程的运行时间如何变化?
主要发现
- 在合成测试数据上,模型在近程(0–5 m)的平均深度估计误差为5.81 cm,在远程(5–10 m)为9.50 cm。
- 在IoU阈值为0.5时,平均精度(AP)达到88.7%,表明在合成数据上实例分割性能优异。
- 该方法可泛化至真实世界图像,在无任何真实世界训练数据的情况下,实现了关节定位的低像素误差。
- 运行时分析显示,置信度预测可实现实时性能(平均10.95 ms),而基于拉普拉斯高斯的关节定位是最慢的组件(平均310.00 ms)。
- 通过结合掩码化的关节置信度图和深度图,该模型成功在包含多台机器人的复杂场景中重建了完整的3D运动链。
- 该方法表明,结合领域随机化的仿真训练可实现对真实世界图像的高效零样本泛化,显著降低对真实数据采集与标注的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。