[论文解读] Learning Depth from Monocular Videos Using Synthetic Data: A Temporally-Consistent Domain Adaptation Approach
本文提出了一种时间一致性域自适应(TCDA)框架,利用带有真实深度、光流和相机位姿的合成视频,以提升真实视频中的单目深度估计性能。通过联合训练图像转换、深度预测、运动掩码和相机位姿网络,并利用合成数据强制实现时间一致性,该方法在KITTI数据集上实现了最先进性能,并在Make3D数据集上展现出良好的泛化能力,显著降低了由运动物体和域偏移引起的误差。
Majority of state-of-the-art monocular depth estimation methods are supervised learning approaches. The success of such approaches heavily depends on the high-quality depth labels which are expensive to obtain. Some recent methods try to learn depth networks by leveraging unsupervised cues from monocular videos which are easier to acquire but less reliable. In this paper, we propose to resolve this dilemma by transferring knowledge from synthetic videos with easily obtainable ground-truth depth labels. Due to the stylish difference between synthetic and real images, we propose a temporally-consistent domain adaptation (TCDA) approach that simultaneously explores labels in the synthetic domain and temporal constraints in the videos to improve style transfer and depth prediction. Furthermore, we make use of the ground-truth optical flow and pose information in the synthetic data to learn moving mask and pose prediction networks. The learned moving masks can filter out moving regions that produces erroneous temporal constraints and the estimated poses provide better initializations for estimating temporal constraints. Experimental results demonstrate the effectiveness of our method and comparable performance against state-of-the-art.
研究动机与目标
- 为解决收集真实世界单目视频深度标注的高昂成本问题。
- 克服无监督方法在处理运动物体和非刚性场景时的局限性。
- 通过引入时间几何约束,提升合成图像与真实图像之间的域自适应能力。
- 不仅利用合成数据进行深度监督,还用于学习运动掩码和相机位姿,以增强真实世界下的泛化能力。
- 在保持深度精度的同时,减少图像转换中的域偏移和结构失真。
提出的方法
- 一种域自适应框架,利用基于生成对抗网络(GAN)的图像转换网络,将合成视频转换为类似真实图像的图像。
- 采用共享编码器-解码器架构,并配备三个任务特定头:深度预测、运动掩码预测和相对相机位姿估计。
- 运动掩码预测网络利用合成数据中的真实光流和相机位姿,识别并掩码动态区域。
- 在合成域和真实域中均应用时间一致性损失,以确保视频帧之间的光度一致性。
- 相机位姿估计网络在合成数据上进行预训练,利用真实位姿提供时间建模在真实视频中的准确初始化。
- 端到端训练通过多任务损失函数联合优化图像转换、深度预测和时间一致性,损失函数包括GAN损失、身份损失、深度监督损失和时间一致性损失。
实验结果
研究问题
- RQ1能否有效利用带有完整监督(深度、光流、位姿)的合成视频来提升真实世界视频中的单目深度估计?
- RQ2引入时间几何一致性如何提升域自适应质量与深度预测精度?
- RQ3能否通过合成数据中的运动物体检测来减轻真实视频中运动对光度一致性造成的负面影响?
- RQ4在合成数据上预训练相机位姿网络在多大程度上提升了真实单目视频中的时间建模能力?
- RQ5所提出的TCDA框架与标准域自适应方法及无监督基线在真实世界基准上的表现相比如何?
主要发现
- 所提出的TCDA方法在KITTI基准上实现了最先进性能,优于现有的无监督方法和域自适应方法。
- 消融实验证实,时间一致性损失(L_STC)和无监督域自适应(UDA)均显著提升性能,两者结合时性能进一步提升。
- 运动掩码预测网络有效降低了动态物体带来的误差,表现为在动态区域掩码光度损失后性能提升。
- 在合成数据上预训练的相机位姿网络提供了更优的初始化,从而在真实视频中实现更精确的时间约束。
- 该方法在Make3D数据集上也表现出良好泛化能力,证明其在KITTI域外的鲁棒性。
- 失败案例揭示了在合成vKITTI数据集中未包含的行人检测存在局限,表明需要更丰富的合成数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。