Skip to main content
QUICK REVIEW

[论文解读] DeepV2D: Video to Depth with Differentiable Structure from Motion

Zachary Teed, Jia Deng|arXiv (Cornell University)|Dec 11, 2018
Advanced Vision and Imaging参考文献 65被引用 89
一句话总结

DeepV2D 是一个端到端可微分的管线,交替深度和运动估计以从视频预测深度,将经典的SfM几何整合为可训练模块。

ABSTRACT

We propose DeepV2D, an end-to-end deep learning architecture for predicting depth from video. DeepV2D combines the representation ability of neural networks with the geometric principles governing image formation. We compose a collection of classical geometric algorithms, which are converted into trainable modules and combined into an end-to-end differentiable architecture. DeepV2D interleaves two stages: motion estimation and depth estimation. During inference, motion and depth estimation are alternated and converge to accurate depth. Code is available https://github.com/princeton-vl/DeepV2D.

研究动机与目标

  • 利用来自运动结构(Structure from Motion, SfM)的几何信息来驱动视频序列的深度估计。
  • 提出一种可微分架构,将运动(Flow-SE3)与深度模块交错。
  • 证明深度与运动之间的块坐标下降收敛到准确的深度。
  • 展示跨数据集的泛化能力以及对最先进方法的有竞争力表现。

提出的方法

  • Depth Module 在多视图上基于学习的二维特征和可微分反投影构建代价体,然后进行3D匹配并通过可微分的软argmax 产生深度。
  • Motion Module 通过最小化对每个像素几何重投影误差的可微分高斯-牛顿步骤来预测位姿更新,使用 Flow-SE3 将2D对应关系映射到 SE(3) 更新。
  • 前向传递在深度与运动模块之间交替,实现类似块坐标下降的迭代式细化。
  • 相机几何通过投影和反投影算子形式化,相对位姿 G_ij = G_j G_i^{-1} 来联系视图。
  • 监督包括深度 L1 损失、边缘感知平滑项,以及通过鲁棒的 Huber 项的光度风格位姿损失。

实验结果

研究问题

  • RQ1能否将可微分架构整合经典SfM步骤(特征匹配、PnP、MVS)以实现视频深度?
  • RQ2在没有地面实测相机位姿的情况下,交替的深度与运动更新是否收敛到准确的深度?
  • RQ3模型在跨数据集和不同输入帧数量上的泛化能力如何?
  • RQ4初始化策略和迭代次数对深度精度的影响如何?
  • RQ5该方法在 NYU、ScanNet、SUN3D、KITTI 等基准上与最先进的多视和单视深度估计方法相比有何竞争力?

主要发现

  • DeepV2D 在多个基准上优于如 DeepTAM、DeMoN、BA-Net 和 MVSNet 等强基线。
  • 该方法在跨数据集泛化方面表现良好,即使在不同数据上训练也能超越某些方法。
  • 需要的迭代较少,更多输入帧可提升精度。
  • 运动更新由对几何重投影误差的可微分高斯-牛顿优化驱动,而深度估计依赖三维代价体和学习的匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。