Skip to main content
QUICK REVIEW

[论文解读] Gen6D: Generalizable Model-Free 6-DoF Object Pose Estimation from RGB Images

Yuan Liu, Yilin Wen|arXiv (Cornell University)|Apr 22, 2022
Advanced Neural Network Applications被引用 5
一句话总结

Gen6D 提出了一种可泛化的、无需模型的6-DoF物体位姿估计算法,仅通过少量未见过物体的位姿参考图像即可预测准确的位姿。它采用了一种新颖的逐像素视角选择器,结合全局归一化和自注意力机制,以应对杂乱背景和稀疏视角的问题,同时结合基于体素的位姿精炼模块,在无需3D模型、深度信息或掩码的条件下,在无模型基准测试中实现了最先进性能。

ABSTRACT

In this paper, we present a generalizable model-free 6-DoF object pose estimator called Gen6D. Existing generalizable pose estimators either need high-quality object models or require additional depth maps or object masks in test time, which significantly limits their application scope. In contrast, our pose estimator only requires some posed images of the unseen object and is able to accurately predict the poses of the object in arbitrary environments. Gen6D consists of an object detector, a viewpoint selector and a pose refiner, all of which do not require the 3D object model and can generalize to unseen objects. Experiments show that Gen6D achieves state-of-the-art results on two model-free datasets: the MOPED dataset and a new GenMOP dataset collected by us. In addition, on the LINEMOD dataset, Gen6D achieves competitive results compared with instance-specific pose estimators. Project page: https://liuyuan-pal.github.io/Gen6D/.

研究动机与目标

  • 开发一种可泛化至未见过物体的6-DoF物体位姿估计算法,且在测试时无需依赖3D模型、深度图或物体掩码。
  • 解决在无模型位姿估计中,于杂乱背景和稀疏参考视角下实现准确视角选择的挑战。
  • 设计一种能有效泛化至未见过物体的位姿精炼模块,且无需访问3D几何结构或实例特定微调。
  • 实现在仅提供RGB图像和少量参考位姿的现实场景中,位姿估计的实用化部署。

提出的方法

  • 一种逐像素图像匹配机制将查询图像与每张参考图像进行比较,计算逐像素相似度得分,聚焦于物体区域并减少背景干扰。
  • 在视角选择器中引入全局归一化和自注意力层,以实现跨参考图像的上下文共享,提升在模糊视角下的选择准确性。
  • 基于体素的位姿精炼模块利用可微渲染技术,通过最小化图像重建损失来优化初始位姿,实现无需3D模型的端到端优化。
  • 该框架集成了物体检测器用于区域定位、视角选择器用于粗略位姿估计,以及位姿精炼模块用于精细化调整,所有组件均以统一方式端到端训练。
  • 该方法仅依赖RGB图像和位姿参考图像,推理过程中避免对深度信息、掩码或3D物体模型的依赖。
  • 系统在多样化数据上进行训练,以学习通用的图像匹配模式,从而实现对未见过物体的零样本泛化能力。

实验结果

研究问题

  • RQ1无模型6-DoF位姿估计算法能否在测试时无需3D模型、深度图或物体掩码的情况下泛化至未见过的物体?
  • RQ2在无模型设置下,如何在杂乱背景和稀疏参考视角条件下提升视角选择性能?
  • RQ3与基于渲染与比较的基线方法相比,基于体素的位姿精炼模块在零样本泛化中能带来多大的性能提升?
  • RQ4在视角选择器中集成全局归一化和自注意力机制,如何提升对背景杂乱和视角模糊的鲁棒性?
  • RQ5训练数据多样性对位姿估计算法泛化能力有何影响?

主要发现

  • Gen6D 在 MOPED 和 GenMOP 数据集上均实现了最先进性能,显著优于如 Latent-Fusion 和 PVNet 等无需深度和掩码的无模型基线方法。
  • 在 MOPED 数据集上,Gen6D 的平均 ADD-AUC 达到 17.90%,显著优于相同输入约束下的 ObjDesc [69](8.55%)和 Latent-Fusion(14.88%)。
  • 在 GenMOP 数据集上,完整视角选择器(含全局归一化和参考视图变换器)相比无此组件的基线,ADD-AUC 提升了 9.4 个百分点。
  • 基于体素的位姿精炼模块在平均 Prj-5 上达到 77.54%,显著优于与相同选择器搭配使用的 DeepIM 精炼模块(42.16%),展现出更强的泛化能力。
  • 仅通过一次精炼步骤,基于体素的精炼模块在 Chair 物体上实现了 50.50% 的 Prj-5,远超 DeepIM 精炼模块的 12.50%。
  • Gen6D 在 2080Ti GPU 上处理 540×960 图像耗时约 0.64 秒,其中位姿精炼模块在执行三次精炼步骤时耗时约 0.5 秒,展现出实用的推理速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。