[论文解读] Structured Depth Prediction in Challenging Monocular Video Sequences
本论文提出了一种针对单目视频序列在具有挑战性条件下的结构化深度预测框架——即非平移相机运动和动态场景下,通过在图模型中使用粒子信念传播将深度估计建模为离散-连续优化问题。该方法扩展至两帧条件随机场(CRFs)以实现短期时间一致性,以及全连接CRF以实现长程时空一致性,在NYUv2、Make3D和MSR-V3D数据集上实现了最先进性能,同时提升了动态场景中深度边界的保真度与真实性。
In this paper, we tackle the problem of estimating the depth of a scene from a monocular video sequence. In particular, we handle challenging scenarios, such as non-translational camera motion and dynamic scenes, where traditional structure from motion and motion stereo methods do not apply. To this end, we first study the problem of depth estimation from a single image. In this context, we exploit the availability of a pool of images for which the depth is known, and formulate monocular depth estimation as a discrete-continuous optimization problem, where the continuous variables encode the depth of the superpixels in the input image, and the discrete ones represent relationships between neighboring superpixels. The solution to this discrete-continuous optimization problem is obtained by performing inference in a graphical model using particle belief propagation. To handle video sequences, we then extend our single image model to a two-frame one that naturally encodes short-range temporal consistency and inherently handles dynamic objects. Based on the prediction of this model, we then introduce a fully-connected pairwise CRF that accounts for longer range spatio-temporal interactions throughout a video. We demonstrate the effectiveness of our model in both the indoor and outdoor scenarios.
研究动机与目标
- 解决在单目视频序列中因非平移相机运动和动态场景导致的深度估计挑战,传统SFM和运动立体视觉方法在此类场景下失效。
- 通过在视频帧之间引入时空一致性,克服单幅图像深度估计方法的局限性。
- 构建一个结构化预测模型,在统一的概率框架中联合推理深度、运动以及场景结构(静态与动态)。
- 在不依赖外部标注或语义标签的前提下,提升复杂场景中深度边界精度与时间平滑性。
- 在标准基准数据集上,证明所提方法在性能上优于单帧方法和先前的基于视频的深度估计技术。
提出的方法
- 将单目深度估计建模为离散-连续优化问题,其中连续变量表示超像素深度,离散变量编码相邻超像素之间的几何关系(如遮挡、共面性)。
- 在所得高阶图模型中使用粒子信念传播进行推理,以处理混合离散-连续推理问题。
- 将单幅图像模型扩展为两帧条件随机场(CRF),联合估计深度与运动,以强化空间一致性和短期时间一致性。
- 在两帧CRF中引入运动感知能量项,显式建模运动物体,并保持其与周围环境之间的深度一致性。
- 在视频序列的所有像素上构建全连接成对CRF,以建模长程时空依赖关系,使用高斯边缘势函数实现高效推理。
- 将两帧CRF的深度预测结果作为全连接CRF的输入,实现对整个视频序列深度图的全局优化。
实验结果
研究问题
- RQ1在无外部标注的情况下,结合粒子信念传播的离散-连续图模型能否有效从单幅单目图像中估计深度?
- RQ2如何将深度估计方法扩展至具有非平移相机运动和动态物体的视频序列,同时保持空间与时间一致性?
- RQ3在具有挑战性的视频序列中,同时建模短程(两帧)与长程(全连接)时空依赖关系,能在多大程度上提升深度估计的准确性?
- RQ4引入运动前景分类器对动态场景中深度预测的真实感与准确性有何影响?
- RQ5所提出的基于视频的方法是否在标准基准测试中优于最先进的单帧与基于视频的深度估计方法?
主要发现
- 尽管在误差指标上的数值提升有限,但所提出的带运动前景分类器的两帧CRF在定性结果中显著提升了深度预测的真实感。
- 在MSR-V3D数据集上,最终的视频模型(Ours-Vid)实现了相对误差(rel)0.253、log10误差0.112和RMS误差1.65,优于单帧基线方法和先前的视频方法。
- 在Building 1的纯旋转序列中,该方法将RMS误差从14.1(DepthTransfer)降低至6.54,表明在具有挑战性的相机运动下性能更优。
- 全连接CRF有效实现了空间与时间平滑性,同时保留了深度不连续性,定性对比显示该方法避免了先前方法中常见的过度平滑问题。
- 与缺乏此类组件的模型相比,带运动感知建模的两帧CRF在深度边界精度、遮挡处理和运动物体建模方面表现更优。
- 消融实验证实,视频框架的所有组件——包括两帧CRF与全连接CRF——均对性能提升有贡献,完整模型在所有指标与数据集上均持续优于消融变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。