[论文解读] Robust RGB-based 6-DoF Pose Estimation without Real Pose Annotations
该论文提出了一种自监督的6-DoF位姿估计方法,在未使用任何真实位姿标注的情况下,于LINEMOD和Occluded-LINEMOD数据集上实现了最先进性能。通过采用基于截断的领域随机化策略,强制真实图像与其合成遮挡版本之间的6-DoF位姿保持一致,该方法在提升对严重遮挡的鲁棒性的同时,利用孪生网络架构学习未标注的真实图像数据。
While much progress has been made in 6-DoF object pose estimation from a single RGB image, the current leading approaches heavily rely on real-annotation data. As such, they remain sensitive to severe occlusions, because covering all possible occlusions with annotated data is intractable. In this paper, we introduce an approach to robustly and accurately estimate the 6-DoF pose in challenging conditions and without using any real pose annotations. To this end, we leverage the intuition that the poses predicted by a network from an image and from its counterpart synthetically altered to mimic occlusion should be consistent, and translate this to a self-supervised loss function. Our experiments on LINEMOD, Occluded-LINEMOD, YCB and new Randomization LINEMOD dataset evidence the robustness of our approach. We achieve state of the art performance on LINEMOD, and OccludedLINEMOD in without real-pose setting, even outperforming methods that rely on real annotations during training on Occluded-LINEMOD.
研究动机与目标
- 解决在缺乏真实位姿标注时,6-DoF位姿估计在严重遮挡下鲁棒性不足的问题。
- 开发一种自监督学习框架,利用未标注的真实图像提升在真实世界场景中的泛化能力。
- 克服现有领域随机化策略在处理大规模遮挡时的局限性。
- 引入一个新基准——随机化LINEMOD(Rand-LINEMOD),用于评估在真实遮挡条件下的鲁棒性。
- 在不依赖真实位姿标注训练数据的情况下,实现在基准数据集上的最先进性能。
提出的方法
- 提出一种基于截断的领域随机化(DR)策略,通过从真实图像中移除图像块来模拟大范围遮挡。
- 设计一种自监督学习损失,强制原始真实图像与其DR增强版本之间的6-DoF位姿预测保持一致。
- 引入一种自监督孪生位姿网络(SSPN),通过共享双分支处理原始图像和增强图像的权重。
- 使用带有真实位姿的合成数据预训练网络,随后在未标注的真实图像上使用自监督损失进行微调。
- 将合成DR数据与通过截断增强的真实数据相结合,弥合领域差距并提升鲁棒性。
- 采用孪生架构强制位姿一致性,使网络能够学习对遮挡不变的表征。
实验结果
研究问题
- RQ1当缺乏真实位姿标注时,自监督学习能否提升6-DoF位姿估计的鲁棒性?
- RQ2基于截断的领域随机化是否能有效模拟严重遮挡,并提升在真实世界场景中的泛化能力?
- RQ3基于原始图像与增强图像之间位姿一致性的自监督损失,是否能在不使用真实标注的情况下超越现有方法?
- RQ4与依赖真实位姿标注的最先进方法相比,所提方法表现如何?
- RQ5该方法能否泛化到包含严重遮挡的真实世界基准,如新引入的Rand-LINEMOD数据集?
主要发现
- 在LINEMOD数据集上,所提方法在ADD指标上达到81.06%的准确率,显著优于基线的67.6%,且未使用任何真实位姿标注。
- 在Occluded-LINEMOD数据集上,该方法在ADD指标上达到42.3%的准确率,超过此前最先进方法的40.8%,并优于使用真实标注的方法。
- 在获得真实位姿标注数据的情况下,该方法在ADD指标上达到51.3%,创下Occluded-LINEMOD数据集的新最先进水平。
- 在YCB数据集上,该方法在所有指标上均表现提升,证明其泛化能力超越LINEMOD。
- 消融实验表明,截断DR和自监督学习均至关重要,二者结合带来最大的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。