QUICK REVIEW
[论文解读] DeepV2D: Video to Depth with Differentiable Structure from Motion
Zachary Teed, Jia Deng|arXiv (Cornell University)|Dec 11, 2018
Advanced Vision and Imaging参考文献 65被引用 89
一句话总结
DeepV2D 是一个端到端可微分的管线,交替深度和运动估计以从视频预测深度,将经典的SfM几何整合为可训练模块。
ABSTRACT
We propose DeepV2D, an end-to-end deep learning architecture for predicting depth from video. DeepV2D combines the representation ability of neural networks with the geometric principles governing image formation. We compose a collection of classical geometric algorithms, which are converted into trainable modules and combined into an end-to-end differentiable architecture. DeepV2D interleaves two stages: motion estimation and depth estimation. During inference, motion and depth estimation are alternated and converge to accurate depth. Code is available https://github.com/princeton-vl/DeepV2D.
研究动机与目标
- 利用来自运动结构(Structure from Motion, SfM)的几何信息来驱动视频序列的深度估计。
- 提出一种可微分架构,将运动(Flow-SE3)与深度模块交错。
- 证明深度与运动之间的块坐标下降收敛到准确的深度。
- 展示跨数据集的泛化能力以及对最先进方法的有竞争力表现。
提出的方法
- Depth Module 在多视图上基于学习的二维特征和可微分反投影构建代价体,然后进行3D匹配并通过可微分的软argmax 产生深度。
- Motion Module 通过最小化对每个像素几何重投影误差的可微分高斯-牛顿步骤来预测位姿更新,使用 Flow-SE3 将2D对应关系映射到 SE(3) 更新。
- 前向传递在深度与运动模块之间交替,实现类似块坐标下降的迭代式细化。
- 相机几何通过投影和反投影算子形式化,相对位姿 G_ij = G_j G_i^{-1} 来联系视图。
- 监督包括深度 L1 损失、边缘感知平滑项,以及通过鲁棒的 Huber 项的光度风格位姿损失。
实验结果
研究问题
- RQ1能否将可微分架构整合经典SfM步骤(特征匹配、PnP、MVS)以实现视频深度?
- RQ2在没有地面实测相机位姿的情况下,交替的深度与运动更新是否收敛到准确的深度?
- RQ3模型在跨数据集和不同输入帧数量上的泛化能力如何?
- RQ4初始化策略和迭代次数对深度精度的影响如何?
- RQ5该方法在 NYU、ScanNet、SUN3D、KITTI 等基准上与最先进的多视和单视深度估计方法相比有何竞争力?
主要发现
- DeepV2D 在多个基准上优于如 DeepTAM、DeMoN、BA-Net 和 MVSNet 等强基线。
- 该方法在跨数据集泛化方面表现良好,即使在不同数据上训练也能超越某些方法。
- 需要的迭代较少,更多输入帧可提升精度。
- 运动更新由对几何重投影误差的可微分高斯-牛顿优化驱动,而深度估计依赖三维代价体和学习的匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。