[论文解读] DONet: Learning Category-Level 6D Object Pose and Size Estimation from Depth Observation.
该论文提出DONet,一种仅依赖深度图像、无需真实世界姿态标注训练数据的类别级6D物体位姿与尺寸估计框架。它利用3D-OCR实现方向一致的3D表征学习,通过GeoReS施加几何对称性约束,并采用MPDE实现镜像配对的尺寸与中心估计,从而在NOCS基准上取得最先进性能,并成功实现对未见类别已知物体的机器人操作。
We propose a method of Category-level 6D Object Pose and Size Estimation (COPSE) from a single depth image, without external pose-annotated real-world training data. While previous works exploit visual cues in RGB(D) images, our method makes inferences based on the rich geometric information of the object in the depth channel alone. Essentially, our framework explores such geometric information by learning the unified 3D Orientation-Consistent Representations (3D-OCR) module, and further enforced by the property of Geometry-constrained Reflection Symmetry (GeoReS) module. The magnitude information of object size and the center point is finally estimated by Mirror-Paired Dimensional Estimation (MPDE) module. Extensive experiments on the category-level NOCS benchmark demonstrate that our framework competes with state-of-the-art approaches that require labeled real-world images. We also deploy our approach to a physical Baxter robot to perform manipulation tasks on unseen but category-known instances, and the results further validate the efficacy of our proposed model. Our videos are available in the supplementary material.
研究动机与目标
- 解决在不依赖真实世界姿态标注训练数据的条件下,实现类别级6D物体位姿与尺寸估计的挑战。
- 利用深度图像中的丰富几何信息推断物体位姿与尺寸,避免对RGB模态的依赖。
- 构建一个统一框架,整合对称性与方向一致性等几何先验,以提升泛化能力。
- 实现在真实世界机器人操作任务中对已知类别内未见实例的零样本泛化能力。
- 通过在物理Baxter机器人上部署,验证方法的鲁棒性与有效性。
提出的方法
- 提出3D-OCR(3D方向一致性表征)模块,用于学习在不同物体朝向下保持一致的统一3D表征。
- 采用GeoReS(几何约束反射对称性)模块,基于深度几何施加对称性约束,提升位姿估计精度。
- 利用MPDE(镜像配对尺寸估计)模块,通过挖掘深度数据中的对称几何模式,预测物体尺寸与中心点。
- 使用合成数据或自监督监督方式端到端训练整个框架,避免对真实世界姿态标注的依赖。
- 利用深度图像的几何结构隐式学习类别级先验,无需显式进行类别特定微调。
- 将所有组件整合为单一统一网络,从单张深度输入联合估计6D位姿(位置与方向)与尺寸。
实验结果
研究问题
- RQ1能否仅使用深度图像,在无真实世界姿态标注数据的条件下,实现准确的6D物体位姿与尺寸估计?
- RQ2如反射对称性与方向一致性等几何先验,在提升类别级泛化能力方面有多有效?
- RQ3仅依赖深度图像的方法在多大程度上可达到与基于RGB的最先进方法相当的性能?
- RQ4该模型在真实世界机器人操作中,能否对已知类别内的未见实例实现泛化?
- RQ53D-OCR、GeoReS与MPDE各组件在性能提升中分别与共同作用如何?
主要发现
- DONet在类别级NOCS基准上表现优异,性能与依赖RGB及真实世界姿态标注数据的最先进方法相当或更优。
- 模型对同一类别内的未见实例具有良好的泛化能力,展现出强大的零样本泛化性能。
- 几何先验(尤其是GeoReS与MPDE)的整合显著提升了估计精度,尤其在对称或结构化物体上表现突出。
- 该框架成功实现对物理Baxter机器人上未见类别已知物体的操作,验证了其在真实场景中的适用性。
- 消融实验表明,每个组件(3D-OCR、GeoReS、MPDE)均对最终性能有显著贡献,完整模型优于各消融变体。
- 该方法在位姿与尺寸估计上均实现高精度,定量结果在NOCS基准上显示出色的mAP与mRE得分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。