[论文解读] CloudAAE: Learning 6D Object Pose Regression with On-line Data Synthesis on Point Clouds
本文提出 CloudAAE,一种6D物体位姿估计系统,通过轻量级、在线的数据合成管道和增强自编码器(AAE)从深度点云回归位姿,学习到一种位姿不变的潜在编码。该方法在 LineMOD 数据集上实现了仅使用合成数据训练的最先进性能,其训练数据生成速度比基于RGB的PBR方法快达1,000倍。
It is often desired to train 6D pose estimation systems on synthetic data because manual annotation is expensive. However, due to the large domain gap between the synthetic and real images, synthesizing color images is expensive. In contrast, this domain gap is considerably smaller and easier to fill for depth information. In this work, we present a system that regresses 6D object pose from depth information represented by point clouds, and a lightweight data synthesis pipeline that creates synthetic point cloud segments for training. We use an augmented autoencoder (AAE) for learning a latent code that encodes 6D object pose information for pose regression. The data synthesis pipeline only requires texture-less 3D object models and desired viewpoints, and it is cheap in terms of both time and hardware storage. Our data synthesis process is up to three orders of magnitude faster than commonly applied approaches that render RGB image data. We show the effectiveness of our system on the LineMOD, LineMOD Occlusion, and YCB Video datasets. The implementation of our system is available at: https://github.com/GeeeG/CloudAAE.
研究动机与目标
- 解决基于RGB的合成数据在6D位姿估计中成本高昂和域差距大的问题。
- 在仅使用深度点云的前提下,降低训练数据生成成本,同时保持高精度的位姿估计性能。
- 开发一种轻量级、在线的数据合成管道,仅需无纹理的3D模型和期望的视角。
- 通过仅编码位姿不变特征的AAE潜在编码,实现准确的6D位姿回归。
- 在LineMOD等基准数据集上,仅使用合成数据即实现最先进性能。
提出的方法
- 系统使用基于点云的增强自编码器(AAE),通过输入增强使潜在编码在非位姿相关变化下保持不变,从而编码6D物体位姿。
- AAE在目标6D位姿下重建无噪声和遮挡的点云片段,确保潜在编码仅捕捉与位姿相关的信息。
- 将潜在编码输入两个独立的深度神经网络,分别回归3D旋转和3D平移。
- 在线数据合成管道仅使用无纹理的3D模型和期望视角生成合成点云片段,避免昂贵的PBR渲染。
- 在单张GPU上,每128个片段的合成数据生成时间少于30ms,13个物体和10万种位姿仅需128MB存储。
- 预测后使用标准ICP优化提升精度,额外增加0.02秒推理时间。

实验结果
研究问题
- RQ1轻量级、在线的点云合成管道能否替代昂贵的基于PBR的RGB渲染用于6D位姿估计?
- RQ2基于AAE的潜在编码是否能有效解耦点云中与位姿无关的其他变化?
- RQ3仅在合成深度点云上训练的6D位姿估计器能否在真实世界基准上实现最先进性能?
- RQ4合成训练数据量和潜在编码维度对泛化能力和精度有何影响?
- RQ5合成与真实数据之间的域差距在多大程度上影响性能?能否通过仅使用深度的合成方法缓解?
主要发现
- 在LineMOD数据集上,该方法仅使用每类10万张合成样本,平均ADD-S准确率达到82.1%,优于其他仅使用合成数据的方法。
- 当每类使用10万张样本时,模型性能接近最优;增加到100万张样本不再带来性能提升,表明具有高数据效率。
- 1024维潜在编码时泛化性能最佳,此时旋转和位移回归均表现最优。
- 该系统的合成数据生成速度比基于PBR的RGB渲染快达1,000倍,13个物体和10万种位姿仅需128MB存储。
- 在YCB-Video数据集上,当使用真实数据与本方法生成的合成数据结合时,性能可与基于RGBD的方法(如DenseFusion、PVN3D)相媲美。
- T-SNE可视化结果表明,学习到的潜在编码在每类物体上聚类良好,证实了其有效的位姿编码能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。