[论文解读] Implicit 3D Orientation Learning for 6D Object Detection from RGB Images
该论文提出了一种基于合成RGB图像通过领域随机化训练的增强自编码器(AAE)的隐式3D方向估计方法,实现了无需真实姿态标注数据的实时6D物体检测。AAE在潜在空间中学习到鲁棒且具备对称性感知的3D方向表征,其在T-LESS数据集上达到最先进性能,在LineMOD数据集上也取得具有竞争力的结果,通过透视校正和ICP优化进一步提升性能。
We propose a real-time RGB-based pipeline for object detection and 6D pose estimation. Our novel 3D orientation estimation is based on a variant of the Denoising Autoencoder that is trained on simulated views of a 3D model using Domain Randomization. This so-called Augmented Autoencoder has several advantages over existing methods: It does not require real, pose-annotated training data, generalizes to various test sensors and inherently handles object and view symmetries. Instead of learning an explicit mapping from input images to object poses, it provides an implicit representation of object orientations defined by samples in a latent space. Our pipeline achieves state-of-the-art performance on the T-LESS dataset both in the RGB and RGB-D domain. We also evaluate on the LineMOD dataset where we can compete with other synthetically trained approaches. We further increase performance by correcting 3D orientation estimates to account for perspective errors when the object deviates from the image center and show extended results.
研究动机与目标
- 开发一种无需真实姿态标注训练数据的实时、仅基于RGB图像的6D物体检测流水线。
- 解决物体对称性、遮挡以及从合成图像到真实图像的域偏移等挑战。
- 通过潜在空间中的隐式表征学习实现鲁棒的3D方向估计,避免显式姿态回归。
- 通过透视校正和基于深度的ICP优化,提升非中心位置物体的估计精度。
- 在嵌入式硬件上验证方法在不同传感器和真实光照条件下的泛化能力。
提出的方法
- 在3D模型的合成RGB图像上训练一种去噪自编码器变体,称为增强自编码器(AAE),并引入随机增强(颜色、几何、光照)。
- 在训练过程中使用领域随机化,以模拟真实世界的变化,缩小仿真到真实之间的域差距。
- 学习一个潜在空间表征,隐式编码3D物体方向,而无需显式映射到SO(3)或四元数。
- 使用2D物体检测器(如SSD)定位并裁剪物体,随后通过AAE推理完成3D方向估计。
- 应用透视校正,根据物体在图像平面上的位置对3D平移估计进行优化,以减少深度缩放误差。
- 在深度数据上使用迭代最近点(ICP)算法进一步优化6D姿态估计,提升RGB-D输入下的精度。
实验结果
研究问题
- RQ1在合成3D模型视图上进行自监督训练的自编码器是否能在无真实姿态标注数据的情况下实现鲁棒的3D方向估计?
- RQ2AAE在真实世界测试图像和多种传感器上的泛化能力如何,特别是在存在域偏移的情况下?
- RQ3AAE的隐式潜在表征是否能自然处理对称物体视图,而无需显式建模对称性?
- RQ4透视校正是否能提升图像中非中心位置物体的6D姿态估计精度?
- RQ5与最先进方法相比,该方法在T-LESS和LineMOD等基准数据集上的表现如何?
主要发现
- 在T-LESS数据集上,AAE在RGB和RGB-D设置下均达到最先进性能,优于现有基于合成数据训练的方法。
- 在LineMOD数据集上,该方法在仅使用RGB的场景中取得具有竞争力的结果,且在未使用ICP优化时已超越SSD6D。
- 引入透视校正显著降低了非中心物体的深度估计误差,整体提升了6D姿态估计精度。
- ICP优化进一步提高了平移估计的精度,尤其在遮挡场景下表现更优,而旋转估计保持稳定。
- 系统在Jetson TX2上运行速度超过13 FPS,证明了其实时性能,并在真实光照和传感器变化下表现出鲁棒性。
- 该方法在不同传感器和真实环境条件下均表现出良好泛化能力,已通过实验室外的实时演示得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。