[论文解读] Self6D: Self-Supervised Monocular 6D Object Pose Estimation
Self6D 提出了一种首个无需真实6D姿态标注的自监督单目6D物体位姿估计方法,通过利用未标注的真实RGB-D数据实现。在大规模合成RGB数据上预训练后,利用神经渲染技术通过可微分渲染实现视觉和几何一致性,从而在真实世界基准上实现最先进性能,在某些情况下优于使用真实标注训练的方法。
6D object pose estimation is a fundamental problem in computer vision. Convolutional Neural Networks (CNNs) have recently proven to be capable of predicting reliable 6D pose estimates even from monocular images. Nonetheless, CNNs are identified as being extremely data-driven, and acquiring adequate annotations is oftentimes very time-consuming and labor intensive. To overcome this shortcoming, we propose the idea of monocular 6D pose estimation by means of self-supervised learning, removing the need for real annotations. After training our proposed network fully supervised with synthetic RGB data, we leverage recent advances in neural rendering to further self-supervise the model on unannotated real RGB-D data, seeking for a visually and geometrically optimal alignment. Extensive evaluations demonstrate that our proposed self-supervision is able to significantly enhance the model's original performance, outperforming all other methods relying on synthetic data or employing elaborate techniques from the domain adaptation realm.
研究动机与目标
- 解决单目6D物体位姿估计中获取真实6D姿态标注的高成本与高难度问题。
- 在不依赖域自适应技术或真实标注的情况下,弥合6D位姿估计中从合成数据到真实数据的域差距。
- 通过可微分神经渲染,利用未标注的真实RGB-D数据实现自监督学习。
- 仅通过真实图像中的视觉和几何一致性,提升在合成数据上预训练模型的泛化能力。
提出的方法
- 在具有已知6D位姿的大规模合成RGB数据上,使用完全监督学习预训练6D位姿估计网络。
- 通过使用可微分神经渲染器重建输入图像,在未标注的真实RGB-D数据上应用自监督。
- 通过从估计的6D位姿渲染预测的3D边界框并将其与输入图像进行比较,强制实现几何一致性。
- 使用结合像素级重建损失和几何一致性损失的多组件损失函数来优化网络。
- 利用可微分渲染技术(如可微分光栅化)实现通过渲染过程的梯度反向传播。
- 采用结合3D物体模型与预测6D位姿的神经渲染流程,生成可微分的图像重建结果。
实验结果
研究问题
- RQ1是否可以通过未标注的真实RGB-D数据进行自监督学习,显著提升6D位姿估计性能,而无需依赖6D姿态标注?
- RQ2可微分神经渲染在多大程度上可用于在6D位姿估计中通过自监督实现视觉和几何一致性?
- RQ3在仅使用RGB-D输入进行自监督学习的情况下,一个在合成数据上预训练的模型在真实数据上的性能能提升多少?
- RQ4通过神经渲染实现的自监督是否比现有的域自适应或随机化技术更有效地弥合合成数据与真实数据之间的域差距?
主要发现
- Self6D 在未使用真实标注的所有最先进方法中表现最佳,在仅使用40%真实数据的HomebrewedDB数据集上,mAR达到71%,相比基线模型的31%显著提升。
- 在LineMOD Occlusion数据集上,Self6D实现32.1%的mAR,超过CDPN(20.8%)和DPOD(6.3%),尽管其仅在合成数据上预训练,并在真实数据上通过自监督进行微调。
- 在Cropped LineMOD基准上,Self6D将平均角度误差从19.8°降低至15.8°,优于PixelDA和DeceptionNet等域自适应方法。
- 该模型达到接近最先进水平的性能,在LineMOD Occlusion上实现70.2%的mAR,接近完全监督的Self6D-UB模型(74% mAR),展现出强大的泛化能力。
- 该方法表现出优异的数据效率:仅使用150张真实图像(占数据集的15%),mAR从31%提升至接近60%,表明在极少真实数据下也能实现快速性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。