[论文解读] Data-driven 6D Pose Tracking by Calibrating Image Residuals in Synthetic Domains
本文提出 $se(3)$-TrackNet,一种基于数据驱动的6D物体位姿跟踪方法,采用一种新型神经网络,结合解耦特征编码与基于李代数的3D方向表示,实现鲁棒的模拟到真实世界的迁移。该方法仅在合成数据上进行训练,并应用领域随机化,实现了90.9Hz的实时性能,在YCB-Video和新的YCBInEOAT基准上达到最先进精度,优于在真实数据上训练的方法,且无需重新初始化。
Tracking the 6D pose of objects in video sequences is important for robot manipulation. This work presents se(3)-TrackNet, a data-driven optimization approach for long term, 6D pose tracking. It aims to identify the optimal relative pose given the current RGB-D observation and a synthetic image conditioned on the previous best estimate and the object's model. The key contribution in this context is a novel neural network architecture, which appropriately disentangles the feature encoding to help reduce domain shift, and an effective 3D orientation representation via Lie Algebra. Consequently, even when the network is trained solely with synthetic data can work effectively over real images. Comprehensive experiments over multiple benchmarks show se(3)-TrackNet achieves consistently robust estimates and outperforms alternatives, even though they have been trained with real images. The approach runs in real time at 90.9Hz. Code, data and supplementary video for this project are available at https://github.com/wenbowen123/iros20-6d-pose-tracking
研究动机与目标
- 开发一种鲁棒、实时的6D物体位姿跟踪系统,最大限度减少对昂贵真实世界标注数据的依赖。
- 通过一种新型解耦特征编码架构,缓解合成训练数据与真实世界测试图像之间的域偏移问题。
- 在遮挡、运动和视角变化等挑战性条件下,实现长期、稳定的位姿跟踪。
- 在基准数据集上实现最先进性能,且在跟踪失败后无需重新初始化。
- 引入一个新的基准数据集 YCBInEOAT,用于评估动态机器人操作场景中的6D位姿跟踪。
提出的方法
- 该方法采用双分支神经网络,分别对当前RGB-D观测和基于先前位姿估计生成的物体合成渲染图像进行特征编码。
- 使用李代数表示法对3D旋转进行建模,以实现对残差位姿变换的有效学习,并采用可微分损失函数。
- 网络仅在通过物理仿真管道生成的合成数据上进行训练,并应用领域随机化以减少域偏移。
- 通过解耦特征编码,将内容信息与变换信息分离,提升对真实图像的泛化能力。
- 系统预测连续帧之间的相对6D位姿变换 ($\Delta T_{\tau}$),通过迭代应用以随时间逐步优化物体位姿。
- 训练过程中使用形状匹配损失,以增强对对称性和物体形状变化的鲁棒性。
实验结果
研究问题
- RQ1仅在合成数据上训练的6D物体位姿跟踪网络,能否在真实世界基准上实现与真实数据训练基线相当或更优的性能?
- RQ2基于李代数的3D方向表示在实现残差位姿变换的精确且可微分学习方面有多有效?
- RQ3解耦特征编码在多大程度上减少了模拟到真实世界6D位姿跟踪中的域偏移?
- RQ4在遮挡和大范围运动等挑战性条件下,该方法能否在无需重新初始化的情况下保持长期跟踪精度?
- RQ5该方法在为动态物体交互设计的机器人操作任务而构建的新基准数据集上的表现如何?
主要发现
- 在YCB-Video基准上,$se(3)$-TrackNet实现了最先进性能,ADD的AUC达到94.71%,ADD-S的AUC达到96.93%,优于真实数据训练的基线方法,且无需任何重新初始化。
- 该方法运行速度达90.9Hz,显著快于先前的最先进方法,适用于机器人操作中的实时应用。
- 在YCBInEOAT数据集上,$se(3)$-TrackNet在全部5个YCB物体上实现了92.66%的ADD AUC和95.53%的ADD-S AUC,表现出对动态操作和滑移的鲁棒性。
- 消融实验表明,若在数据生成过程中移除物理仿真,性能将下降至91.88% AUC(ADD),表明真实动态在合成数据中的重要性。
- 若在训练和推理过程中移除深度模态,性能下降至75.65% AUC(ADD),凸显深度监督的价值。
- 若对当前图像和渲染图像使用共享编码器,性能接近为零(0.28% AUC),证明独立特征学习对跟踪任务至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。