[论文解读] Two Stream Networks for Self-Supervised Ego-Motion Estimation
该论文提出了一种双流神经网络,通过自监督方式从无标签的RGB视频中联合学习单目深度和自身运动,结合外观特征与推断的深度特征以提升精度。该方法引入了一种促进稀疏性的数据增强策略,减少过拟合,并在KITTI基准上实现最先进性能,且在包含100万帧的城市驾驶数据集上性能随数据量逐步提升。
Learning depth and camera ego-motion from raw unlabeled RGB video streams is seeing exciting progress through self-supervision from strong geometric cues. To leverage not only appearance but also scene geometry, we propose a novel self-supervised two-stream network using RGB and inferred depth information for accurate visual odometry. In addition, we introduce a sparsity-inducing data augmentation policy for ego-motion learning that effectively regularizes the pose network to enable stronger generalization performance. As a result, we show that our proposed two-stream pose network achieves state-of-the-art results among learning-based methods on the KITTI odometry benchmark, and is especially suited for self-supervision at scale. Our experiments on a large-scale urban driving dataset of 1 million frames indicate that the performance of our proposed architecture does indeed scale progressively with more data.
研究动机与目标
- 解决现有自监督自身运动方法仅依赖密集外观变化、忽略稀疏几何结构的局限性。
- 通过引入一种针对姿态网络正则化的新型数据增强策略,改善自监督自身运动学习中的泛化能力。
- 证明自监督单目自身运动估计的性能在很大程度上取决于模型架构,而不仅仅是损失函数设计。
- 研究在大规模无标签数据集上进行自监督预训练的可扩展性,以提升在KITTI等基准上的下游性能。
- 量化在包含100万帧的城市驾驶数据集上预训练带来的性能增益,展示随着数据量增加性能逐步提升。
提出的方法
- 设计一种双流神经网络架构,平行处理RGB图像和推断的单目深度预测结果,利用两种模态的特征以提升自身运动估计性能。
- 为深度和姿态网络共享编码器主干网络,分别使用独立的头部进行深度和自身运动预测,实现特征共享与联合优化。
- 引入一种促进稀疏性的数据增强策略,在训练过程中随机遮挡输入图像中的图像块,促使姿态网络学习鲁棒的稀疏表征。
- 基于可微图像扭曲应用光度一致性损失,利用相邻帧的几何重建来监督深度和自身运动预测。
- 实施多尺度监督策略进行深度估计,在四个不同分辨率尺度上预测深度,并通过跳跃连接保留细节。
- 在光度损失中结合结构相似性(SSIM)和L1损失分量,以提升重建质量并减少扭曲图像中的模糊。
实验结果
研究问题
- RQ1在双流架构中结合RGB和推断的深度特征,是否能显著提升自监督自身运动估计性能,相比仅使用外观的模型?
- RQ2促进稀疏性的数据增强策略是否能有效正则化姿态网络并减少自监督自身运动学习中的过拟合?
- RQ3自监督自身运动模型的性能如何随无标签数据量的增加而变化?
- RQ4在大规模、多样化的城市驾驶数据集上进行预训练,能在多大程度上提升在标准基准(如KITTI)上的性能?
- RQ5在自监督学习中,深度与自身运动预测之间的相互依赖关系,是否应通过网络架构设计而非损失函数修改来最优解决?
主要发现
- 所提出的双流网络在KITTI里程计基准上实现了基于学习方法的最先进性能,当在KITTI和Cityscapes数据集上预训练时,在KITTI测试集上的相对平移误差(t_rel)为0.91,旋转误差(r_rel)为1.22。
- 随着数据量增加,性能呈现明显提升趋势:当在100万帧的大规模城市驾驶数据集上预训练时,KITTI上的相对平移误差达到1.45%。
- 促进稀疏性的增强策略减少了过拟合并提升了泛化能力,相比标准增强策略,姿态估计精度相对提升了20%-30%。
- 当在大规模数据集上进行预训练时,KITTI基准上的性能显著提升:在D1M数据集上预训练时,KITTI测试集上的相对平移误差为3.88%,而仅在KITTI上训练时为4.74%。
- 双流架构通过同时利用外观和几何线索,优于单流基线模型,旋转误差降低了40%。
- 消融实验验证了架构设计对性能的影响大于损失函数工程,证实了在自监督SfM中多流特征融合的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。