[论文解读] RA-Depth: Resolution Adaptive Self-Supervised Monocular Depth Estimation
RA-Depth 提出了一种自监督单目深度估计方法,在通过任意尺度数据增强和双高分辨率网络结合跨尺度深度一致性损失实现分辨率自适应的同时,达到了最先进性能。该方法通过在多尺度图像上进行训练并强制跨尺度的一致性,学习尺度不变的深度预测,显著提升了模型在不同分辨率下的泛化能力,而无需重新训练。
Existing self-supervised monocular depth estimation methods can get rid of expensive annotations and achieve promising results. However, these methods suffer from severe performance degradation when directly adopting a model trained on a fixed resolution to evaluate at other different resolutions. In this paper, we propose a resolution adaptive self-supervised monocular depth estimation method (RA-Depth) by learning the scale invariance of the scene depth. Specifically, we propose a simple yet efficient data augmentation method to generate images with arbitrary scales for the same scene. Then, we develop a dual high-resolution network that uses the multi-path encoder and decoder with dense interactions to aggregate multi-scale features for accurate depth inference. Finally, to explicitly learn the scale invariance of the scene depth, we formulate a cross-scale depth consistency loss on depth predictions with different scales. Extensive experiments on the KITTI, Make3D and NYU-V2 datasets demonstrate that RA-Depth not only achieves state-of-the-art performance, but also exhibits a good ability of resolution adaptation.
研究动机与目标
- 为解决自监督单目深度估计中缺乏分辨率自适应的问题,即当测试分辨率与训练分辨率不同时性能下降。
- 开发一种方法,使单个训练好的模型无需重新训练即可在多种图像分辨率间泛化。
- 通过数据增强和新型损失函数,隐式和显式地学习场景深度的尺度不变性。
- 设计一种高效的双高分辨率网络(Dual HRNet)架构,通过多尺度特征融合实现高精度深度预测,同时保持低参数量和计算开销。
提出的方法
- 提出一种任意尺度数据增强(AS-Aug)方法,通过缩放、裁剪和拼接,从单张输入图像生成三张不同尺度的图像,保留图像细节并模拟多样的相机内参。
- 采用双高分辨率网络(Dual HRNet),配备多路径编码器和解码器,实现跨尺度的密集特征交互,提升特征聚合效果。
- 引入跨尺度深度一致性损失,强制同一场景在不同尺度输入下预测的深度保持一致,显式学习尺度不变性。
- 使用 HRNet 作为主干编码器,以在整个网络中保持高分辨率表征,提升特征保真度和深度预测精度。
- 通过立体或单目序列的几何监督进行端到端训练,无需真实深度标注。
- 结合深度监督损失和所提出的跨尺度一致性损失进行网络优化,以提升在不同分辨率下的泛化能力。
实验结果
研究问题
- RQ1自监督单目深度估计模型是否能在不重新训练的情况下,有效泛化到不同输入分辨率?
- RQ2如何设计数据增强方法,以隐式地教会模型场景深度的尺度不变性?
- RQ3显式强制多尺度输入下深度预测的一致性会产生何种影响?
- RQ4具有多尺度特征融合的双高分辨率网络如何提升深度估计的精度与效率?
- RQ5轻量化模型是否能在保持低参数量和 FLOP 数量的同时实现最先进性能?
主要发现
- RA-Depth 在 KITTI、Make3D 和 NYU-V2 数据集上均达到最先进性能,在 KITTI 上的 AbsRel 为 0.096,SqRel 为 0.632,RMSE 为 4.216。
- 在不同分辨率下测试时,与基线相比,AbsRel 降低 29.6%,SqRel 降低 41.4%,RMSE 降低 22.2%。
- 跨尺度深度一致性损失显著提升了分辨率自适应性能,使准确率(δ<1.25)相比基线提高 11.4%。
- RA-Depth 仅使用 9.98M 参数和 10.78 GFLOPs,便实现最佳性能,优于参数量更大的模型。
- 所提出的任意尺度数据增强(AS-Aug)显著提升了泛化能力,优于先前方法(如 Bian-Aug),在保留图像细节和实现多尺度训练方面表现更优。
- 双 HRNet 架构实现了高效的多尺度特征融合,以更低的计算和参数成本,达到比现有 SOTA 模型更高的精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。