Skip to main content
QUICK REVIEW

[论文解读] I Like to Move It: 6D Pose Estimation as an Action Decision Process

Benjamin Busam, Hyun Jun Jung|arXiv (Cornell University)|Sep 26, 2020
Robot Manipulation and Learning参考文献 76被引用 18
一句话总结

该论文提出了一种新颖的6D物体位姿估计方法,将任务建模为基于轻量级CNN的迭代动作决策过程,从单张RGB图像预测逐次的位姿修正。通过序列化、学习得到的动作逐步优化位姿,并根据运动动态调整推理成本,该方法在YCB和Laval数据集上实现了最先进(SOTA)的精度,且无需微调即可泛化到未见过的物体。

ABSTRACT

Object pose estimation is an integral part of robot vision and AR. Previous 6D pose retrieval pipelines treat the problem either as a regression task or discretize the pose space to classify. We change this paradigm and reformulate the problem as an action decision process where an initial pose is updated in incremental discrete steps that sequentially move a virtual 3D rendering towards the correct solution. A neural network estimates likely moves from a single RGB image iteratively and determines so an acceptable final pose. In comparison to other approaches that train object-specific pose models, we learn a decision process. This allows for a lightweight architecture while it naturally generalizes to unseen objects. A coherent stop action for process termination enables dynamic reduction of the computation cost if there are insignificant changes in a video sequence. Instead of a static inference time, we thereby automatically increase the runtime depending on the object motion. Robustness and accuracy of our action decision network are evaluated on Laval and YCB video scenes where we significantly improve the state-of-the-art.

研究动机与目标

  • 解决现有6D位姿估计方法存在的局限性,即需要针对特定物体进行训练且泛化能力差。
  • 在仅使用单张RGB图像输入的前提下,提升在噪声、遮挡和杂乱环境下的鲁棒性与准确性。
  • 通过根据物体运动和位姿变化动态调整推理复杂度,降低计算成本。
  • 通过学习决策过程而非为每个物体建立独立模型,实现对未见物体的零样本泛化。
  • 利用视频序列实现迭代优化,通过前一帧的位姿初始化提升跟踪性能,并减少运行时间。

提出的方法

  • 该方法将6D位姿估计建模为一个序列决策过程,其中神经网络预测离散的位姿动作,以逐步优化3D物体渲染结果。
  • 一个轻量级CNN处理裁剪后的图像与渲染图像对,以在每一步预测6D位姿更新(平移与旋转)。
  • 将预测的动作应用于当前位姿,并生成新的渲染图像,再进行重新裁剪以供下一轮迭代使用。
  • 当位姿变化变得不显著时,网络会预测“停止”动作,从而在视频序列中实现推理成本的动态降低。
  • 网络在合成数据上进行训练,使用高质量渲染图像叠加真实背景,并采用数据增强方案模拟遮挡与杂乱环境。
  • 在视频推理中,第t帧的位姿被用作第t+1帧的初始位姿,从而减少所需迭代次数。

实验结果

研究问题

  • RQ16D位姿估计能否被有效重构为序列动作决策过程,而非回归或分类任务?
  • RQ2轻量级共享策略网络是否比针对特定物体的模型具有更好的泛化能力?
  • RQ3基于位姿变化的动态复杂度降低是否能提升视频序列中的推理效率?
  • RQ4与最先进方法相比,该方法在不同遮挡程度、杂乱程度和噪声水平下的表现如何?
  • RQ5仅使用单张RGB图像并结合迭代优化,是否能在YCB和Laval等基准数据集上超越现有方法?

主要发现

  • 所提方法在YCB数据集上实现了最先进性能,所有物体在0.1m的ADD阈值曲线下平均AUC达到83.47%。
  • 在Laval数据集上,对于饼干罐(cookie jar)在0%遮挡条件下,方法实现了3.82mm的平均平移误差和6.48°的平均旋转误差,显著优于先前工作。
  • 不使用渲染深度输入的模型(Ours w/o D)误差更高,表明深度监督能提升鲁棒性,尤其在遮挡条件下。
  • 该方法无需微调即可泛化到未见物体,得益于所学习的决策策略,展现出零样本能力。
  • 在视频序列中,通过利用前一帧的初始位姿,动态复杂度降低方案显著减少了推理成本,当运动较小时所需迭代次数更少。
  • 该方法在高遮挡和杂乱等挑战性条件下,优于强基线方法如D-IM、PV-N和R&C。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。