[论文解读] 6D Object Pose Regression via Supervised Learning on Point Clouds
本文提出一种仅使用深度导出点云的监督深度学习方法进行6D物体位姿估计,采用独立网络分别处理旋转(通过轴角表示和测地线损失)与平移回归。该方法在YCB-Video数据集上优于最先进技术,表明经过精心设计的仅几何点云特征可超越使用RGB-D数据的方法。
This paper addresses the task of estimating the 6 degrees of freedom pose of a known 3D object from depth information represented by a point cloud. Deep features learned by convolutional neural networks from color information have been the dominant features to be used for inferring object poses, while depth information receives much less attention. However, depth information contains rich geometric information of the object shape, which is important for inferring the object pose. We use depth information represented by point clouds as the input to both deep networks and geometry-based pose refinement and use separate networks for rotation and translation regression. We argue that the axis-angle representation is a suitable rotation representation for deep learning, and use a geodesic loss function for rotation regression. Ablation studies show that these design choices outperform alternatives such as the quaternion representation and L2 loss, or regressing translation and rotation with the same network. Our simple yet effective approach clearly outperforms state-of-the-art methods on the YCB-video dataset. The implementation and trained model are avaliable at: https://github.com/GeeeG/CloudPose.
研究动机与目标
- 解决仅使用点云中几何深度信息进行6D物体位姿估计的问题,避免依赖颜色数据。
- 探究为旋转和平移回归分别使用独立网络是否优于共享架构。
- 评估在深度学习框架中,轴角表示与四元数表示在旋转回归中的性能差异。
- 比较在学习框架中,测地线距离与L2损失在测量旋转误差时的有效性。
- 证明基于点云的深度学习系统在6D位姿估计中可超越使用RGB-D数据的最先进方法。
提出的方法
- 使用类似PointNet的架构处理无序点云输入,以表示三维物体的几何结构。
- 采用两个独立的深度神经网络:一个用于预测轴角格式的3D旋转,另一个用于预测3D平移。
- 为旋转回归应用测地线距离作为损失函数,以确保数学上合理的优化。
- 使用最远点采样对点云进行下采样,同时保留表面结构,以实现一致的输入。
- 利用预测的初始位姿进行迭代最近点(ICP)精化,以提升精度。
- 对四元数输出进行归一化并转换为轴角格式,以确保旋转表示方法的公平评估。

实验结果
研究问题
- RQ1能否仅使用无序点云表示的深度信息准确估计6D物体位姿?
- RQ2使用独立的深度网络分别回归平移与旋转,是否优于共享架构?
- RQ3在深度学习框架中,轴角表示是否优于四元数表示用于旋转回归?
- RQ4测地线距离是否作为损失函数比L2损失更有效衡量旋转误差?
- RQ5纯几何的、基于点云的深度学习系统能否超越使用RGB-D数据的最先进方法?
主要发现
- 所提方法采用独立的旋转与平移网络,在YCB-Video数据集上达到AD 76.0和ADS 91.3,优于共享架构的变体。
- 使用轴角表示进行旋转回归时,旋转误差小于10°的准确率达到41.3%,而四元数表示在相同条件下为37.1%。
- 测地线损失在旋转误差小于10°时达到41.3%的准确率,略优于L2损失(40.8%),且具有更强的数学依据。
- 该系统在YCB-Video基准上超越了两种最先进方法,尽管后者使用了颜色与深度信息。
- 前向传播进行位姿估计耗时0.11秒,10次ICP精化迭代耗时0.3秒(在Titan X GPU上)。
- 消融实验表明,即使增加参数容量,当旋转与平移网络共享层时性能仍会下降。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。