[论文解读] UnDEMoN 2.0: Improved Depth and Ego Motion Estimation through Deep Image Sampling
UnDEMoN 2.0 通过将深度图像采样网络(DISNet)与双线性采样器结合,提出了一种轻量化、改进的单目深度与自运动估计网络,以提升图像重建精度。该混合方法在 KITTI 数据集上实现了最先进性能,参数量仅为原始 UnDEMoN 的 25%,显著提高了深度与位姿估计精度,同时大幅减小了模型规模。
In this paper, we provide an improved version of UnDEMoN model for depth and ego motion estimation from monocular images. The improvement is achieved by combining the standard bi-linear sampler with a deep network based image sampling model (DIS-NET) to provide better image reconstruction capabilities on which the depth estimation accuracy depends in un-supervised learning models. While DIS-NET provides higher order regression and larger input search space, the bi-linear sampler provides geometric constraints necessary for reducing the size of the solution space for an ill-posed problem of this kind. This combination is shown to provide significant improvement in depth and pose estimation accuracy outperforming all existing state-of-the-art methods in this category. In addition, the modified network uses far less number of tunable parameters making it one of the lightest deep network model for depth estimation. The proposed model is labeled as "UnDEMoN 2.0" indicating an improvement over the existing UnDEMoN model. The efficacy of the proposed model is demonstrated through rigorous experimental analysis on the standard KITTI dataset.
研究动机与目标
- 通过提升图像重建能力,改善无监督单目深度估计中的深度与自运动估计精度。
- 在保持或提升性能的同时,降低模型复杂度与参数数量。
- 结合基于深度学习的图像采样优势与双线性采样的几何约束,实现更好的泛化能力。
- 通过结合高阶回归与几何先验,缓解无监督深度估计的病态性问题。
- 在 KITTI 基准测试的 Eigen 分割上,展示优于现有最先进方法的性能表现。
提出的方法
- 提出一种深度图像采样网络(DISNet),利用完整图像输入执行高阶回归以实现图像重建,替代标准双线性采样。
- 将 DISNet 与双线性图像采样器(BIS)结合,同时利用高精度插值与几何约束,缩小病态深度估计的解空间。
- 在 DispNet 和 DISNet 中均采用多尺度结构,以提升特征表示能力与重建保真度。
- 采用轻量化网络设计,减少层数,使总参数量降至原始 UnDEMoN 模型的 25%。
- 通过结合 DISNet 与 BIS 的重建损失、位姿一致性损失以及深度正则化损失进行联合训练。
- 利用预测的深度与位姿进行逆图像扭曲,以重建源图像,最小化光度一致性损失。
实验结果
研究问题
- RQ1基于深度学习的图像采样网络是否能在无监督深度估计中,相比标准双线性采样,实现更高的重建精度?
- RQ2将深度图像采样与几何约束下的双线性采样相结合,是否能优于单独使用任一方法,实现更优的深度与位姿估计?
- RQ3能否在不牺牲单目深度估计性能的前提下,实现模型参数量的显著减少?
- RQ4所提方法在 KITTI 数据集上的表现与当前最先进无监督深度估计模型相比如何?
- RQ5在图像重建中使用高阶回归在多大程度上可降低重建误差并提升深度估计精度?
主要发现
- UnDEMoN 2.0 在 KITTI 的 Eigen 分割上实现了单目深度与自运动估计的最先进性能,优于所有现有无监督方法。
- 模型将可训练参数量减少至原始 UnDEMoN 的 25%,成为目前最轻量化的深度估计深度神经网络之一。
- DISNet 与双线性采样的结合显著降低了图像重建误差,从而提升了深度与位姿估计的精度。
- 该方法在 KITTI 数据集上的绝对相对差异、平方相对差异、RMSE 线性、RMSE 对数及阈值等指标上均取得更优结果。
- 图 6 的定性结果表明,UnDEMoN 2.0 在大运动等复杂场景中,生成的深度预测结果比最先进方法更清晰、更准确。
- 结构相似性指数(SSIM)结果证实,UnDEMoN 2.0 重建的图像在感知上更接近真实图像,优于对比模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。