Skip to main content
QUICK REVIEW

[论文解读] ENG: End-to-end Neural Geometry for Robust Depth and Pose Estimation using CNNs

Thanuja Dharmasiri, Andrew Spek|arXiv (Cornell University)|Jul 16, 2018
Advanced Vision and Imaging参考文献 36被引用 10
一句话总结

本文提出了一种基于CNN的端到端深度学习框架,可从单目或双目图像对中联合预测深度、光流和相机位姿。通过整合几何约束和置信度估计,该模型在NYUv2和KITTI数据集上的深度预测任务中达到最先进性能,并在位姿和光流估计方面优于先前方法,其创新之处在于为光流预测引入了可学习的置信度矩阵。

ABSTRACT

Recovering structure and motion parameters given a image pair or a sequence of images is a well studied problem in computer vision. This is often achieved by employing Structure from Motion (SfM) or Simultaneous Localization and Mapping (SLAM) algorithms based on the real-time requirements. Recently, with the advent of Convolutional Neural Networks (CNNs) researchers have explored the possibility of using machine learning techniques to reconstruct the 3D structure of a scene and jointly predict the camera pose. In this work, we present a framework that achieves state-of-the-art performance on single image depth prediction for both indoor and outdoor scenes. The depth prediction system is then extended to predict optical flow and ultimately the camera pose and trained end-to-end. Our motion estimation framework outperforms the previous motion prediction systems and we also demonstrate that the state-of-the-art metric depths can be further improved using the knowledge of pose.

研究动机与目标

  • 开发一种统一的深度学习框架,从RGB图像中以端到端方式预测深度、光流和相机位姿。
  • 通过几何感知学习,提升在室内(NYUv2)和室外(KITTI)数据集上的单图像深度预测性能。
  • 通过利用预测的深度和光流作为中间监督信号,提升运动预测的准确性。
  • 引入一种新型神经网络模块,用于预测表示光流估计不确定性的完整信息矩阵。

提出的方法

  • 该框架采用渐进式训练:首先使用带有跳跃连接的密集CNN架构,从单幅图像中预测深度。
  • 接着,光流估计网络接收双目图像对及其预测的深度图,生成具有像素级置信度分数的光流。
  • 位姿估计模块利用光流和深度预测结果,回归SE(3)变换的对数表示,以估计相对相机运动。
  • 在整个网络中采用带有连接跳跃连接的密集块架构,以实现特征复用并改善梯度流动。
  • 采用多任务损失函数进行端到端训练:包括深度损失、光流损失和位姿损失,各损失项按适当权重分配。
  • 引入一个置信度矩阵预测头,输出每个像素的2×2协方差矩阵,以估计光流预测的不确定性。

实验结果

研究问题

  • RQ1与分阶段方法相比,端到端深度学习框架是否能更准确地联合预测深度、光流和相机位姿?
  • RQ2将预测的深度作为中间监督信号,是否能提升下游运动估计任务的性能?
  • RQ3神经网络能否有效学习预测光流预测的完整置信度矩阵,从而提升在困难区域的鲁棒性?
  • RQ4在标准深度和运动估计基准上,该方法与最先进模型相比表现如何?

主要发现

  • 该模型在单图像深度预测任务中达到最先进性能,在NYUv2(室内)和KITTI(室外)数据集上均优于先前方法。
  • 与以往基于深度学习的方法相比,该框架在TUM和KITTI基准上的相机位姿估计精度显著提升。
  • 将预测深度作为辅助监督信号,显著提升了度量深度估计的性能,证明了几何一致性的重要性。
  • 该方法是首个学习完整2×2光流置信度矩阵的模型,其不确定性估计比标量置信度分数更具鲁棒性。
  • 采用多任务学习的端到端训练方案,相比独立训练,显著提升了所有任务的泛化能力和整体性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。