[论文解读] Web Stereo Video Supervision for Depth Prediction from Dynamic Scenes
本文提出一种数据驱动方法,用于在动态非刚性场景中进行单目深度预测,利用网络抓取的立体视频作为弱监督信号。通过引入一种新型的归一化多尺度梯度损失,该方法无需已知的相机内参或基线,即可从连续帧中学习准确的深度预测,其性能优于单图方法及现有基于多视角的方法,在包含移动人物等非刚性场景中表现更优。
We present a fully data-driven method to compute depth from diverse monocular video sequences that contain large amounts of non-rigid objects, e.g., people. In order to learn reconstruction cues for non-rigid scenes, we introduce a new dataset consisting of stereo videos scraped in-the-wild. This dataset has a wide variety of scene types, and features large amounts of nonrigid objects, especially people. From this, we compute disparity maps to be used as supervision to train our approach. We propose a loss function that allows us to generate a depth prediction even with unknown camera intrinsics and stereo baselines in the dataset. We validate the use of large amounts of Internet video by evaluating our method on existing video datasets with depth supervision, including SINTEL, and KITTI, and show that our approach generalizes better to natural scenes.
研究动机与目标
- 解决传统几何方法因缺乏刚性而失效的非刚性动态场景深度预测挑战。
- 通过利用视频中的时序与几何线索,克服现有数据驱动方法依赖刚性场景或单张图像的局限性。
- 开发一种训练框架,利用未校准的、来自互联网的立体视频作为监督信号,即使相机内参与基线未知亦可训练。
- 构建一个大规模、多样化、真实场景中的立体视频数据集,以支持在真实非刚性场景中的训练。
提出的方法
- 该方法使用从网络抓取的、真实场景中收集的大规模(150万帧)立体视频数据集,涵盖多样化场景与丰富非刚性物体(如人物)。
- 从立体视频中计算视差图,并将其作为弱监督信号用于训练深度预测网络。
- 提出一种新型的归一化多尺度梯度损失,通过利用视差差分与反深度差分之间的几何关系,使模型能够在未校准数据上进行训练。
- 网络以两张连续的单目帧和光流作为输入,结合单图的语义线索与运动带来的几何线索。
- 损失函数设计用于保持相对深度距离,生成比序数损失更平滑、更准确的深度图。
- 该方法端到端训练,且在KITTI和Sintel等真实世界数据集上具有良好的泛化能力,即使未显式进行相机标定亦可。
实验结果
研究问题
- RQ1基于未校准、互联网来源的立体视频进行训练的数据驱动模型,能否泛化到真实世界中的非刚性场景以实现深度预测?
- RQ2当视频序列中相机内参与基线未知或变化时,如何实现深度预测的监督?
- RQ3与单图基线相比,结合光流与连续帧的时序信息是否能提升非刚性场景中的深度预测性能?
- RQ4在未校准设置下,能否通过保持相对深度差分的损失函数超越序数损失或尺度不变损失?
- RQ5在复杂人体运动存在的情况下,该模型在刚性与非刚性场景中的性能与最先进方法相比如何?
主要发现
- 所提方法在KITTI行人子集上优于单图深度预测模型(如MegaDepth与RedWeb),证明其在非刚性场景中具有更优的泛化能力。
- 在Sintel数据集上,模型取得NMG 0.890、MRE 0.311与SILog 0.172,优于DEMON方法,展现出跨数据集的强泛化能力。
- 在所提出的WSVD数据集上进行训练,相较于在KITTI或其他刚性场景数据集上训练的模型,Sintel上的误差更低,KITTI上的性能也更优。
- 在Sintel上,加入光流与第二帧作为输入后,NMG从0.993降至0.890,证实时序信息显著提升了深度估计性能。
- 该模型在其他数据集上的泛化能力优于在KITTI上训练的模型,表明WSVD数据集的多样性提升了对领域偏移的鲁棒性。
- 局限性包括在无纹理区域与远距离场景中监督不可靠,因立体匹配失败导致错误的深度预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。