Skip to main content
QUICK REVIEW

[论文解读] Robust 6D Object Pose Estimation by Learning RGB-D Features

Meng Tian, Liang Pan|arXiv (Cornell University)|Feb 29, 2020
Robot Manipulation and Learning参考文献 42被引用 4
一句话总结

该论文提出了一种新颖的深度学习方法,利用RGB-D特征实现鲁棒的6D物体位姿估计,通过旋转锚点与不确定性感知的偏差预测,采用离散-连续公式化方法解决旋转回归中的局部最优问题。该方法在LINEMOD(92.8% ADD)和YCB-Video(83.8% ADD)数据集上达到最先进性能,相较于以往的RGB-D方法,在小尺寸、低纹理物体上提升高达6.6%,并通过对旋转和位移分别进行约束回归,显著提升了对遮挡和光照变化的鲁棒性。

ABSTRACT

Accurate 6D object pose estimation is fundamental to robotic manipulation and grasping. Previous methods follow a local optimization approach which minimizes the distance between closest point pairs to handle the rotation ambiguity of symmetric objects. In this work, we propose a novel discrete-continuous formulation for rotation regression to resolve this local-optimum problem. We uniformly sample rotation anchors in SO(3), and predict a constrained deviation from each anchor to the target, as well as uncertainty scores for selecting the best prediction. Additionally, the object location is detected by aggregating point-wise vectors pointing to the 3D center. Experiments on two benchmarks: LINEMOD and YCB-Video, show that the proposed method outperforms state-of-the-art approaches. Our code is available at https://github.com/mentian/object-posenet.

研究动机与目标

  • 解决由对称物体和模糊旋转预测引起的6D物体位姿估计中的局部最优问题。
  • 提升基于RGB-D的位姿估计在遮挡、背景杂波和光照变化条件下的鲁棒性。
  • 开发一个统一的深度神经网络,通过密集提取的RGB-D特征分别回归旋转和位移。
  • 引入不确定性感知的旋转锚点预测,以提升最佳位姿假设的选择可靠性。
  • 实现实时推理速度,适用于机器人操作应用。

提出的方法

  • 通过在SO(3)上均匀采样旋转锚点,对旋转空间进行离散化,实现局部回归。
  • 针对每个锚点,网络预测相对于目标旋转的受约束偏差向量,降低陷入局部最优的风险。
  • 为每个锚点预测不确定性分数,并在推理阶段用于选择最可靠的旋转估计。
  • 通过在每个点回归指向3D物体中心的单位向量来估计位移,随后通过基于RANSAC的投票层聚合预测结果。
  • 采用旋转和位移损失函数的组合进行端到端训练,通过自监督条件概率最大化实现不确定性监督。
  • 使用CNN主干网络密集提取RGB-D特征,融合颜色与几何信息以提升特征表示能力。

实验结果

研究问题

  • RQ1旋转回归的离散-连续公式化是否能减少6D位姿估计中的局部最优问题?
  • RQ2不确定性感知预测在对称物体模糊性条件下如何提升旋转估计的鲁棒性?
  • RQ3分别回归旋转和位移是否能在精度与鲁棒性方面优于联合优化?
  • RQ4密集RGB-D特征提取在低纹理或遮挡物体上的性能提升程度如何?
  • RQ5所提方法是否能在保持标准基准高精度的同时实现实时推理?

主要发现

  • 在LINEMOD数据集上,该方法使用ADD指标达到92.8%的准确率,显著优于之前最先进方法(86.3%)。
  • 在更具挑战性的YCB-Video数据集上,该方法在ADD指标下达到83.8%的准确率,较先前最先进方法Per-Pixel DF(79.2%)提升4.6个百分点。
  • 在小尺寸、低纹理的“holepuncher”物体上,该方法比基线方法高出13.6%的准确率,展现出对低纹理挑战的强鲁棒性。
  • 在LINEMOD数据集上,该方法比PVNet和Per-Pixel DF高出6.6%的检测准确率,尤其在对称和小尺寸物体上表现优异。
  • 网络在单张GPU上运行速度约为14 FPS(每帧0.07秒),支持适用于机器人应用的实时推理。
  • 定性结果表明,由于采用了离散-连续旋转公式化,该方法避免了PoseCNN和DenseFusion中常见的局部最优预测,尤其在对称物体上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。