[论文解读] Multimodal Scale Consistency and Awareness for Monocular Self-Supervised Depth Estimation
本文提出了一种GPS-to-Scale(g2s)损失函数,用于单目自监督深度估计,通过在训练过程中利用低频平面GPS数据来强制实现尺度一致性和尺度感知,而推理阶段无需GPS。该方法在KITTI数据集上显著提升了深度估计的准确性和清晰度,即使在GPS稀疏或缺乏高度信息的情况下依然表现优异,且在Make3D和Cityscapes等分布外数据集上也展现出良好的泛化能力,优于当前最先进方法。
Dense depth estimation is essential to scene-understanding for autonomous driving. However, recent self-supervised approaches on monocular videos suffer from scale-inconsistency across long sequences. Utilizing data from the ubiquitously copresent global positioning systems (GPS), we tackle this challenge by proposing a dynamically-weighted GPS-to-Scale (g2s) loss to complement the appearance-based losses. We emphasize that the GPS is needed only during the multimodal training, and not at inference. The relative distance between frames captured through the GPS provides a scale signal that is independent of the camera setup and scene distribution, resulting in richer learned feature representations. Through extensive evaluation on multiple datasets, we demonstrate scale-consistent and -aware depth estimation during inference, improving the performance even when training with low-frequency GPS data.
研究动机与目标
- 解决单目自监督深度估计中的尺度不一致性问题,这是自动驾驶应用中的关键限制。
- 通过引入来自GPS数据的多模态学习信号,克服单目视觉固有的尺度模糊性问题。
- 实现在推理阶段无需LiDAR或立体监督即可获得度量尺度的深度预测。
- 通过利用低频和二维GPS(无高度信息)提升方法的鲁棒性,增强实际部署可行性。
- 通过学习与场景和相机无关的深度表征,提升在分布外数据集上的泛化能力。
提出的方法
- 提出一种动态加权的GPS-to-Scale(g2s)损失,将自运动网络预测的相对位移与GPS测量的相对位移进行比较。
- 利用透视投影模型将深度与自运动预测关联,确保几何一致性。
- 仅在训练阶段应用g2s损失,GPS数据仅用作尺度信号以强制实现尺度一致性和感知。
- 采用指数递增的加权策略对g2s损失随训练轮次进行调度,以提升收敛性和性能。
- 在自监督框架中将g2s损失与标准的基于外观的光度损失、平滑损失和自动掩码损失相结合。
- 通过结合视觉外观和GPS衍生的尺度信号的多模态损失,端到端地联合训练深度和自运动网络。
实验结果
研究问题
- RQ1GPS衍生的相对位移能否为单目自监督深度估计提供可靠的尺度信号?
- RQ2g2s损失在GPS频率较低以及缺乏高度信息时的性能表现如何?
- RQ3g2s损失在不同场景和数据集上对尺度一致性和感知的提升程度如何?
- RQ4所提方法是否能在无需微调的情况下泛化到Make3D和Cityscapes等分布外数据集?
- RQ5与仅基于外观的基线相比,该多模态自监督框架是否能学习到更丰富、更具迁移性的特征表征?
主要发现
- 所提出的g2s损失显著提升了尺度一致性,使Make3D上的深度尺度因子标准差降低至0.85,Cityscapes上为1.22,而基线方法分别为17.24和22.44。
- Make3D上的平均深度尺度因子为2.81,Cityscapes上为4.01,表明具有很强的尺度感知能力,其值远比竞争方法更接近1。
- 即使在低频GPS(最低至1 Hz)且无高度信息的情况下,该方法在KITTI Eigen划分上仍实现了最先进性能,绝对相对误差(Abs Rel)为0.112,δ < 1.253的准确率为0.981。
- 在KITTI深度基准测试中,该方法优于Monodepth2及其他SOTA方法,在M+G训练设置下实现了14.16的SILog误差和3.65的SqRel误差。
- 定性结果表明,在Make3D和Cityscapes上,物体边界(如建筑结构、树干和车辆细节)的分割更加精细,证实了特征学习能力的提升。
- 消融实验表明,指数加权的g2s损失(公式5)性能最佳,绝对相对误差为0.112,δ < 1.253准确率为0.981,优于恒定和线性加权策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。