Skip to main content
QUICK REVIEW

[论文解读] MVDepthNet: Real-time Multiview Depth Estimation Neural Network

Kaixuan Wang, Shaojie Shen|arXiv (Cornell University)|Jul 23, 2018
Advanced Vision and Imaging参考文献 3被引用 4
一句话总结

MVDepthNet 是一种用于多视角深度估计的实时卷积神经网络,通过从多个图像-位姿对构建代价体,实现无论相机参数或视角数量如何变化,均能高效且具备几何感知能力的深度预测。它在实时单目稠密映射任务中达到最先进精度,在室内和室外数据集上均优于 DeMoN 和 FCRN 等方法,尤其在处理无纹理区域和反光区域方面表现更优。

ABSTRACT

Although deep neural networks have been widely applied to computer vision problems, extending them into multiview depth estimation is non-trivial. In this paper, we present MVDepthNet, a convolutional network to solve the depth estimation problem given several image-pose pairs from a localized monocular camera in neighbor viewpoints. Multiview observations are encoded in a cost volume and then combined with the reference image to estimate the depth map using an encoder-decoder network. By encoding the information from multiview observations into the cost volume, our method achieves real-time performance and the flexibility of traditional methods that can be applied regardless of the camera intrinsic parameters and the number of images. Geometric data augmentation is used to train MVDepthNet. We further apply MVDepthNet in a monocular dense mapping system that continuously estimates depth maps using a single localized moving camera. Experiments show that our method can generate depth maps efficiently and precisely.

研究动机与目标

  • 开发一种基于已知相机位姿的多视角单目图像输入、支持端到端训练的实时深度估计神经网络。
  • 解决单目系统中多视角深度估计的挑战,如任意基线的对极线与参数化三角测量问题。
  • 在不重新训练网络架构的前提下,实现对不同相机内参、视角数量和场景类型的泛化能力。
  • 提升对无纹理区域、反光表面以及远距离深度估计的鲁棒性,突破 RGB-D 传感器的限制。
  • 将网络集成至实时单目稠密映射系统中,实现连续深度估计。

提出的方法

  • MVDepthNet 通过编码输入图像-位姿对中的多视角观测,构建代价体,以表示跨视角的潜在深度假设。
  • 代价体经由编码器-解码器网络处理,以预测深度图,避免显式地在不同视角间进行像素匹配。
  • 对代价体和真实深度图应用几何数据增强,以在训练过程中保持像素级一致性。
  • 将相机位姿与内参参数编码至代价体中,实现无需固定对极约束的三角测量。
  • 采用监督损失函数在深度图上进行端到端训练,并通过数据增强提升在有限真实世界数据上的泛化能力。
  • 该方法被集成至单目稠密映射系统中,利用移动相机实现连续深度估计。

实验结果

研究问题

  • RQ1深度学习模型能否在无需立体校准的情况下,仅凭已知位姿的多视角单目图像实现实时深度估计?
  • RQ2如何在神经网络中有效编码多视角几何约束,以实现对不同基线与内参参数的鲁棒深度预测?
  • RQ3在有限真实世界数据集上训练时,几何数据增强是否能保持像素级一致性并提升泛化能力?
  • RQ4在具有挑战性的场景中,该方法与 RGB-D 相机及当前最先进单目深度估计方法相比,在准确率与鲁棒性方面表现如何?
  • RQ5该网络能否在 RGB-D 传感器失效的无纹理、反光及远距离物体区域实现泛化?

主要发现

  • MVDepthNet 在标准硬件上实现实时性能,支持单目稠密映射系统中的连续深度估计。
  • 在 TUM RGB-D 数据集中,MVDepthNet 在 desk 序列上实现 0.109 的平均 L1-rel 误差,优于 VI-MEAN(0.623)与 REMODE(1.314)。
  • 在 ICL-NUIM 数据集中,MVDepthNet 在 xyz 序列上实现 0.076 的平均 L1-rel 误差,优于 VI-MEAN(0.564)与 REMODE(0.801)。
  • MVDepthNet 在无纹理与反光区域成功实现深度估计,如图 1 中红圈所示的定性结果,而 RGB-D 相机在此类区域失效。
  • 所有测试序列中,MVDepthNet 实现了 100% 的有效深度估计密度,而 VI-MEAN 与 REMODE 因在无纹理或运动模糊区域失效,导致密度显著降低。
  • MVDepthNet 有效减少了 VI-MEAN 中常见的条纹伪影(其使用一维正则化),且在处理遮挡方面优于依赖像素分类损失的 DeepMVS。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。