Skip to main content
QUICK REVIEW

[论文解读] Deep Model-Based 6D Pose Refinement in RGB

Fabian Manhardt, Wadim Kehl|arXiv (Cornell University)|Oct 7, 2018
Advanced Vision and Imaging参考文献 32被引用 4
一句话总结

本文提出一种基于深度学习的方法,利用可微分视觉损失在RGB图像中进行6D姿态精炼,通过匹配物体轮廓实现对齐,无需对应点、分割或显式外观建模。该方法仅使用合成RGB数据即可实现接近ICP的精度,且运行速度达到实时,展现出对遮挡、对称性及不良初始化的鲁棒性。

ABSTRACT

We present a novel approach for model-based 6D pose refinement in color data. Building on the established idea of contour-based pose tracking, we teach a deep neural network to predict a translational and rotational update. At the core, we propose a new visual loss that drives the pose update by aligning object contours, thus avoiding the definition of any explicit appearance model. In contrast to previous work our method is correspondence-free, segmentation-free, can handle occlusion and is agnostic to geometrical symmetry as well as visual ambiguities. Additionally, we observe a strong robustness towards rough initialization. The approach can run in real-time and produces pose accuracies that come close to 3D ICP without the need for depth data. Furthermore, our networks are trained from purely synthetic data and will be published together with the refinement code to ensure reproducibility.

研究动机与目标

  • 解决在无深度数据的RGB单目场景中进行6D姿态精炼的挑战。
  • 克服现有方法依赖手工设计的分割、对应点或外观模型的局限性。
  • 在不进行人工调参的前提下,实现对遮挡、对称性及视觉模糊的鲁棒姿态精炼。
  • 在保持接近基于深度的ICP方法精度的同时,实现实时性能。
  • 完全在合成数据上进行网络训练,以确保泛化能力和可复现性。

提出的方法

  • 提出一种可微分视觉损失,通过最大化渲染物体轮廓与场景轮廓之间的重叠来驱动姿态精炼。
  • 训练一个卷积神经网络(CNN),根据RGB输入和合成渲染图像预测6D姿态更新(平移与旋转)。
  • 使用具有不同光照和遮挡条件的合成RGB数据,隐式学习物体外观与形状。
  • 通过仅依赖轮廓对齐作为优化信号,避免显式建模外观或几何结构。
  • 设计一种无需参数的优化框架,无需RANSAC、分割或对应点匹配。
  • 通过在多样化CAD模型上进行训练,并在同类别中未见的实例上进行评估,确保模型泛化能力。

实验结果

研究问题

  • RQ1能否仅通过轮廓对齐,而不依赖显式外观或对应点建模,使深度神经网络在RGB图像中实现6D物体姿态精炼?
  • RQ2在合成数据上训练的网络在具有遮挡和视觉模糊的真实RGB图像上,其泛化能力达到何种程度?
  • RQ3与传统ICP或基于外观的方法相比,基于轮廓的学习在精度和鲁棒性方面表现如何?
  • RQ4该方法能否在无需人工干预的情况下处理对称物体和严重的初始化误差?
  • RQ5与RGB-D方法相比,缺乏深度数据是否显著降低性能?

主要发现

  • 该方法在无需深度数据的情况下实现了接近3D ICP的精度,展现出在纯RGB场景下的强大性能。
  • 在遮挡数据集上,ADD得分从6.2%提升至28.5%,表明对部分遮挡具有显著鲁棒性。
  • 在遮挡条件下,与基线方法相比,X和Y轴方向的平移误差减少4mm,Z轴方向减少28mm。
  • 采用视觉损失训练的网络在对称物体上的VSS指标相比MSE损失训练高出14%,凸显了对称性处理的重要性。
  • 该方法可泛化至类别级跟踪任务,在仅用多样化相似CAD模型训练后,成功对未见过的水杯和碗模型进行了姿态精炼。
  • 失败案例包括对形状或颜色相似的物体误识别,以及在严重遮挡下恢复不完全,表明当前在复杂视觉混淆场景下仍存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。