Skip to main content
QUICK REVIEW

[论文解读] Consistent Video Depth Estimation

Xuan Luo, Jia‐Bin Huang|arXiv (Cornell University)|Apr 30, 2020
Advanced Vision and Imaging参考文献 89被引用 9
一句话总结

该论文提出了一种测试时微调方法,结合传统的运动结构重建(structure-from-motion)与预训练的单目图像深度网络,从单目视频生成全局一致的稠密深度图。通过利用COLMAP提供的几何约束并优化学习到的先验,该方法在动态或纹理丰富的场景中,相比以往方法实现了更高的精度和更优的时间稳定性。

ABSTRACT

We present an algorithm for reconstructing dense, geometrically consistent depth for all pixels in a monocular video. We leverage a conventional structure-from-motion reconstruction to establish geometric constraints on pixels in the video. Unlike the ad-hoc priors in classical reconstruction, we use a learning-based prior, i.e., a convolutional neural network trained for single-image depth estimation. At test time, we fine-tune this network to satisfy the geometric constraints of a particular input video, while retaining its ability to synthesize plausible depth details in parts of the video that are less constrained. We show through quantitative validation that our method achieves higher accuracy and a higher degree of geometric consistency than previous monocular reconstruction methods. Visually, our results appear more stable. Our algorithm is able to handle challenging hand-held captured input videos with a moderate degree of dynamic motion. The improved quality of the reconstruction enables several applications, such as scene reconstruction and advanced video-based visual effects.

研究动机与目标

  • 解决从单目视频进行视频深度估计时存在的几何不一致性和闪烁问题。
  • 克服传统多视角立体视觉方法的局限性,后者常因运动或无纹理区域导致重建不完整。
  • 利用基于学习的先验,在约束不足的区域合成合理的深度细节,同时保持全局一致性。
  • 实现对手持拍摄、随意采集的视频(具有中等动态运动)的鲁棒深度估计。
  • 支持高级应用,如三维场景重建和基于视频的自动化视觉特效。

提出的方法

  • 使用COLMAP从单目视频中计算稀疏三维结构和相机位姿,建立几何约束。
  • 使用FlowNet2提取帧间光流,并通过前向-后向一致性检查过滤不可靠的光流。
  • 在测试时,利用COLMAP提供的几何约束和光流,对预训练的单图像深度估计网络进行微调。
  • 将微调损失公式化为帧间光度一致性和几何一致性相结合的形式。
  • 通过保留预训练模型的归纳偏差,保持网络在低置信度区域生成细节的能力。
  • 通过中值缩放将最终深度图与稀疏重建对齐,确保全局尺度一致性。

实验结果

研究问题

  • RQ1学习到的深度先验是否能有效适应以在视频序列中强制实现几何一致性?
  • RQ2与独立帧预测相比,使用几何约束进行测试时微调在提升深度精度和时间稳定性方面效果如何?
  • RQ3预训练的单图像深度模型在多大程度上能泛化到视频任务,同时在动态运动下保持一致性?
  • RQ4该方法在具有运动模糊、小基线和动态物体的具有挑战性的现实世界视频上的表现如何?
  • RQ5所生成的一致深度图是否能实现以往不一致深度图无法实现的新型基于视频的视觉特效?

主要发现

  • 在KITTI基准上,该方法在低分辨率(384×112)输出下实现了绝对相对误差(Abs Rel)0.130和<1.25准确率0.878,优于Monodepth2及其他最先进方法。
  • 该方法显著减少了闪烁和几何不一致现象,即使在中等动态运动的场景中,也能生成时间稳定的深度图。
  • 定量结果表明,该方法在KITTI Eigen划分上实现了0.144的绝对相对误差和0.979的<1.25准确率,显著优于以往方法在一致性和精度方面的表现。
  • 视觉结果表明,该方法在处理运动物体和无纹理区域方面表现更优,孔洞更少,深度细节更合理。
  • 该方法实现了新型基于视频的视觉特效,如深度感知合成与三维场景操作,如补充视频所示。
  • 尽管在位姿估计和速度方面存在局限,该方法在与现有单目深度估计技术相比,在具有挑战性的现实世界视频上仍表现出更优的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。