Skip to main content
QUICK REVIEW

[论文解读] CosyPose: Consistent multi-view multi-object 6D pose estimation

Yann Labbé, Justin Carpentier|arXiv (Cornell University)|Aug 19, 2020
Robotics and Sensor-Based Localization参考文献 58被引用 404
一句话总结

CosyPose 提出了一种多视角、多物体 6D 物体位姿估计框架,能够从已知相机视角未知的 RGB 图像中联合估计相机位姿和物体 6D 位姿。它采用基于渲染与比较的单视角位姿估计算法,结合鲁棒的 RANSAC 物体级匹配方法实现跨视角匹配,并通过全局物体级捆绑调整实现一致且精确的场景重建,无需深度传感器,在 YCB-Video 和 T-LESS 数据集上显著优于当前最先进方法。

ABSTRACT

We introduce an approach for recovering the 6D pose of multiple known objects in a scene captured by a set of input images with unknown camera viewpoints. First, we present a single-view single-object 6D pose estimation method, which we use to generate 6D object pose hypotheses. Second, we develop a robust method for matching individual 6D object pose hypotheses across different input images in order to jointly estimate camera viewpoints and 6D poses of all objects in a single consistent scene. Our approach explicitly handles object symmetries, does not require depth measurements, is robust to missing or incorrect object hypotheses, and automatically recovers the number of objects in the scene. Third, we develop a method for global scene refinement given multiple object hypotheses and their correspondences across views. This is achieved by solving an object-level bundle adjustment problem that refines the poses of cameras and objects to minimize the reprojection error in all views. We demonstrate that the proposed method, dubbed CosyPose, outperforms current state-of-the-art results for single-view and multi-view 6D object pose estimation by a large margin on two challenging benchmarks: the YCB-Video and T-LESS datasets. Code and pre-trained models are available on the project webpage https://www.di.ens.fr/willow/research/cosypose/.

研究动机与目标

  • 解决从相机位姿未知的多张 RGB 图像中估计场景内多个已知物体一致 6D 位姿的挑战。
  • 在不依赖深度传感器的前提下,处理物体对称性、检测缺失或错误以及未知物体数量的问题。
  • 通过一种新颖的渲染与比较方法,提升单视角 6D 位姿估计的准确性。
  • 利用全局优化策略,在多视角间联合优化相机位姿与物体位姿。
  • 在复杂场景中提升对误报和干扰物的鲁棒性。

提出的方法

  • 一种基于受 DeepIM 启发的渲染与比较方法的单视角 6D 位姿估计算法,从 RGB 图像生成 6D 位姿假设。
  • 一种鲁棒的、基于 RANSAC 的物体级匹配流程,用于在不同视角间匹配 6D 位姿假设,以估计相对相机位姿并识别一致的物体实例。
  • 通过物体级捆绑调整进行全局优化,最小化所有视角中的重投影误差,从而提升位姿精度。
  • 一种 3D 非极大值抑制(NMS)策略,用于解决重复的物体位姿假设,仅保留最一致的候选结果。
  • 一种通过分析一致位姿假设匹配自动恢复场景中物体数量的方法。
  • 一种鲁棒的过滤机制,将不一致的位姿假设(如来自干扰物的)标记为异常值,从而提升对未见物体的泛化能力。

实验结果

研究问题

  • RQ1多视角、多物体 6D 位姿估计系统是否能在不依赖已知相机位姿或深度数据的情况下实现一致的场景重建?
  • RQ2如何利用跨视角一致性过滤来自单视角网络的不一致或错误 6D 位姿假设?
  • RQ3当结合多个视角时,全局捆绑调整在多大程度上提升了位姿精度?
  • RQ4该方法在复杂场景中如何处理对称、无纹理或部分遮挡的物体?
  • RQ5系统能否自动检测并拒绝来自不在物体数据库中的干扰物的假阳性检测?

主要发现

  • CosyPose 在 T-LESS 数据集上相比之前最先进方法实现了 34.2% 的绝对性能提升,显著提高了 6D 位姿估计的准确性。
  • 尽管未要求已知相机位姿或限制每类仅一个物体,该多视角框架在 YCB-Video 上仍优于 [20]。
  • 该方法通过识别跨视角中不一致的位姿假设,成功过滤了来自干扰物的假阳性检测,可视化与定量结果均证实了这一点。
  • 3D NMS 的使用有效解决了重复的物体位姿假设,仅保留每个物体实例最一致的 6D 位姿估计。
  • 当某些视角中仅可见两个物体时,只要在多个视角中存在至少三个一致的物体候选,系统仍能正确重建场景。
  • 识别并分析了诸如一致假阳性(如来自相似视角)和稀疏视角中漏检等局限性,并提出了潜在的缓解策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。