Skip to main content
QUICK REVIEW

[论文解读] DFineNet: Ego-Motion Estimation and Depth Refinement from Sparse, Noisy Depth Input with RGB Guidance

Yilun Zhang, Ty Nguyen|arXiv (Cornell University)|Mar 15, 2019
Advanced Vision and Imaging参考文献 32被引用 15
一句话总结

DFineNet 提出了一种端到端的深度学习框架,通过 RGB 引导联合估计相机自运动并优化稀疏、噪声较大的深度输入。通过联合训练深度和位姿网络,该方法在深度补全和位姿估计任务上均表现出色,尤其在稀疏且噪声较大的深度输入条件下,优于 KITTI 和 TUM 数据集上的最先进方法。

ABSTRACT

Depth estimation is an important capability for autonomous vehicles to understand and reconstruct 3D environments as well as avoid obstacles during the execution. Accurate depth sensors such as LiDARs are often heavy, expensive and can only provide sparse depth while lighter depth sensors such as stereo cameras are noiser in comparison. We propose an end-to-end learning algorithm that is capable of using sparse, noisy input depth for refinement and depth completion. Our model also produces the camera pose as a byproduct, making it a great solution for autonomous systems. We evaluate our approach on both indoor and outdoor datasets. Empirical results show that our method performs well on the KITTI~\cite{kitti_geiger2012we} dataset when compared to other competing methods, while having superior performance in dealing with sparse, noisy input depth on the TUM~\cite{sturm12iros} dataset.

研究动机与目标

  • 解决在尺寸、重量和功耗(SWaP)约束下,自主系统中准确估计深度与自运动的挑战。
  • 通过联合使用 RGB 和稀疏、噪声深度输入训练深度与位姿网络,提升深度补全与位姿估计性能。
  • 克服现有方法将深度与位姿估计分开处理或假设输入为无噪声深度的局限性。
  • 实现对多种深度传感器(包括噪声较大的立体相机和稀疏 LiDAR)的鲁棒性能。
  • 开发统一框架,通过 RGB 与深度的跨模态监督,同时提升深度质量与位姿精度。

提出的方法

  • 该框架采用双分支卷积神经网络:一个分支用于深度预测,另一个用于自运动(位姿)估计,两者均基于 RGB 图像和稀疏深度输入。
  • 采用可微分的深度优化模块,利用连续帧之间的几何一致性来优化稀疏、噪声较大的深度图。
  • 通过结合光度重建损失、深度监督损失和位姿回归损失的多任务损失函数进行端到端训练。
  • 关键创新在于深度与位姿的联合优化,使位姿估计可引导深度补全,反之亦然,从而提升鲁棒性。
  • 模型使用可微分的图像扭曲层,通过利用估计的位姿从扭曲的 RGB 图像中重建图像来监督深度预测。
  • 在训练过程中引入数据增强与噪声建模,以提升对真实世界噪声深度输入的泛化能力。

实验结果

研究问题

  • RQ1与解耦方法相比,联合学习深度补全与自运动估计是否能提升两个任务的性能?
  • RQ2当输入深度稀疏且噪声较大(如低成本立体相机或 ToF 传感器)时,模型表现如何?
  • RQ3使用 RGB 和深度监督进行端到端训练是否能带来比依赖干净、密集深度监督的方法更好的泛化性能?
  • RQ4在具有挑战性的条件下,模型在位姿精度与深度补全质量方面与最先进方法相比表现如何?
  • RQ5模型能否有效应对真实世界传感器限制,如滚动快门失真和低纹理环境?

主要发现

  • 在 TUM RGBD 数据集上,DFineNet 的 ATE(0.0101 m)和 RE(0.0021)均低于对比方法,优于 Ma [13] 和 sfmlearner。
  • 在噪声输入下的深度补全任务中,DFineNet 在噪声训练下 RMSE 为 180.63,在无噪声训练但测试时使用噪声的条件下 RMSE 为 779.58,显著优于 Sfmlearner 和 Ma [13] 在噪声条件下的表现。
  • 在 TUM 数据集上的光度损失为 0.0369,是所有方法中最低的,表明图像重建质量更优。
  • 在 KITTI 数据集上,DFineNet 的光度损失最低(0.0726),尽管 ATE 和 RE 略高于某些基线方法,但表明其与真实深度和位姿的对齐更优。
  • 图 4 的定性结果表明,DFineNet 生成的深度图更密集、更准确,且在纹理贫乏区域的伪影更少。
  • 消融实验表明,使用噪声深度输入进行联合训练可提升鲁棒性,仅在干净深度上训练的模型在噪声输入测试时表现失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。