Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Geometric Correspondence for Category-Level 6D Object Pose Estimation in the Wild

Kaifeng Zhang, Yang Fu|arXiv (Cornell University)|Oct 13, 2022
Robotics and Sensor-Based Localization被引用 8
一句话总结

该论文提出了一种自监督框架,用于在真实世界(in-the-wild)图像中进行类别级6D物体位姿估计,无需人类标注或模拟的6D位姿标签。该方法引入了类别表面嵌入(Categorical Surface Embedding, CSE),以学习密集的2D-3D几何对应关系,并采用新颖的跨2D-3D空间、不同实例和时间步长的循环一致性损失,在Wild6D和REAL275数据集上实现了最先进性能,且完全无需监督。

ABSTRACT

While 6D object pose estimation has wide applications across computer vision and robotics, it remains far from being solved due to the lack of annotations. The problem becomes even more challenging when moving to category-level 6D pose, which requires generalization to unseen instances. Current approaches are restricted by leveraging annotations from simulation or collected from humans. In this paper, we overcome this barrier by introducing a self-supervised learning approach trained directly on large-scale real-world object videos for category-level 6D pose estimation in the wild. Our framework reconstructs the canonical 3D shape of an object category and learns dense correspondences between input images and the canonical shape via surface embedding. For training, we propose novel geometrical cycle-consistency losses which construct cycles across 2D-3D spaces, across different instances and different time steps. The learned correspondence can be applied for 6D pose estimation and other downstream tasks such as keypoint transfer. Surprisingly, our method, without any human annotations or simulators, can achieve on-par or even better performance than previous supervised or semi-supervised methods on in-the-wild images. Our project page is: https://kywind.github.io/self-pose .

研究动机与目标

  • 解决在3D标注稀缺或不可用的真实世界环境中进行类别级6D物体位姿估计的挑战。
  • 通过直接在大规模未标注真实世界视频上进行训练,而非依赖合成数据或人工标注,克服模拟到真实世界的域差距。
  • 在无任何监督的情况下,学习图像与规范3D形状先验之间的密集2D-3D几何对应关系。
  • 设计新颖的循环一致性损失,以在2D与3D空间、不同物体实例以及时间序列之间强制实现几何一致性。
  • 通过自监督表示学习,实现对未见物体实例和真实世界条件下的零样本泛化能力。

提出的方法

  • 提出类别表面嵌入(Categorical Surface Embedding, CSE),一种定义在每个物体类别规范3D网格表面的可学习特征场。
  • 使用视觉Transformer编码器提取图像特征,并通过与CSE的相似性计算建立密集的2D-3D几何对应关系。
  • 构建2D-3D循环一致性损失:通过对应关系将2D像素映射到3D顶点,再通过刚性变换投影回2D;重建的2D位置应与原始位置匹配。
  • 引入跨实例循环一致性:将一个实例中的2D像素映射到3D,经由规范空间转移到另一实例,再投影回2D,并利用DINO特征验证实例间的对应关系。
  • 引入跨时间循环一致性:将连续视频帧中的同一物体视为不同实例,以在对应学习中强制实现时间一致性。
  • 采用多任务损失进行训练:包括RGB、深度和分割的重建损失,结合所提出的循环一致性损失与深度监督损失。

实验结果

研究问题

  • RQ1一种自监督方法是否能在无任何6D位姿标注的情况下,学习到准确的类别级6D物体位姿估计所需的2D-3D几何对应关系?
  • RQ2在2D-3D空间、不同实例和时间步长之间,循环一致性损失在提升对应学习与位姿估计精度方面的有效性如何?
  • RQ3仅在未标注真实世界视频上进行训练的模型,与监督或半监督基线相比,在真实世界、非受限环境中的泛化能力如何?
  • RQ4所提出的类别表面嵌入(CSE)表示是否优于无结构化3D特征编码的直接2D-3D映射方法?
  • RQ5深度监督与多层次循环一致性损失的结合,如何提升对形状与外观变化的鲁棒性?

主要发现

  • 所提出的自监督方法在Wild6D基准上实现了最先进性能,优于或匹配依赖合成或人工标注6D位姿数据的监督与半监督方法。
  • 在Wild6D上,完整模型在IOU 0.25下达到92.3%的mAP,在IOU 0.5下达到68.2%,在5° 5cm下达到35.3%的mAP,显著优于缺少关键组件的消融实验。
  • 消融研究显示,若移除跨实例与跨时间循环一致性损失,IOU 0.5下的mAP下降5.2%,证明其在学习语义感知对应关系中的关键作用。
  • 同时加入跨实例与跨时间循环一致性损失后,笔记本类别在5° 5cm下的mAP提升5.8%,CUB数据集提升30.6%,表明泛化能力显著增强。
  • 深度损失对深度敏感类别至关重要:若移除该损失,IOU 0.5下的mAP下降15.6个百分点,凸显其在减少错位中的关键作用。
  • CSE表示至关重要——无表面嵌入的消融实验使IOU 0.5下的mAP从68.2%降至57.1%,表明结构化3D特征编码是性能的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。