Skip to main content
QUICK REVIEW

[论文解读] DF-Net: Unsupervised Joint Learning of Depth and Flow using Cross-Task Consistency

Yuliang Zou, Zelun Luo|arXiv (Cornell University)|Sep 5, 2018
Advanced Vision and Imaging参考文献 55被引用 4
一句话总结

该论文提出DF-Net,一种无监督框架,通过强制执行跨任务几何一致性,在无标签单目视频上联合训练深度和光流网络。通过利用预测的深度和相机运动来合成刚性3D场景光流,并与估计的光流进行比较,该方法引入了一种跨任务一致性损失,从而在无需真实标签的情况下提升了两个任务的性能。

ABSTRACT

We present an unsupervised learning framework for simultaneously training single-view depth prediction and optical flow estimation models using unlabeled video sequences. Existing unsupervised methods often exploit brightness constancy and spatial smoothness priors to train depth or flow models. In this paper, we propose to leverage geometric consistency as additional supervisory signals. Our core idea is that for rigid regions we can use the predicted scene depth and camera motion to synthesize 2D optical flow by backprojecting the induced 3D scene flow. The discrepancy between the rigid flow (from depth prediction and camera motion) and the estimated flow (from optical flow model) allows us to impose a cross-task consistency loss. While all the networks are jointly optimized during training, they can be applied independently at test time. Extensive experiments demonstrate that our depth and flow models compare favorably with state-of-the-art unsupervised methods.

研究动机与目标

  • 解决在真实世界设置中像素级真实标签成本高且稀缺的问题,以实现深度和光流模型的训练。
  • 利用深度、相机运动与光流之间的几何关系,以提升无监督学习性能。
  • 克服现有无监督方法仅依赖亮度恒定性和空间平滑性所带来的局限,这些方法在运动边界处常会失效。
  • 通过一种新型的一致性损失实现深度与光流网络的联合训练,以强制预测光流与合成光流之间对齐。
  • 证明联合训练的模型在性能上可与有监督方法相媲美,并优于现有的无监督基线方法。

提出的方法

  • 提出一种跨任务一致性损失,以强制预测光流与从预测深度和相机运动合成的光流之间保持几何一致性。
  • 利用预测的深度和估计的相机运动将3D场景光流反投影,再将其投影回2D以生成合成光流。
  • 使用结合跨任务一致性损失与标准无监督损失(如光度损失和平滑性损失)的多任务损失,联合训练深度和光流网络。
  • 应用前向-后向一致性作为正则化项,以提高光流估计的鲁棒性,尽管其核心创新在于跨任务一致性。
  • 使用5帧姿态估计网络从视频序列中估计相机运动,用于合成3D场景光流。
  • 仅使用无标签视频序列,以端到端方式无监督地训练整个系统,无需真实深度或光流标注。

实验结果

研究问题

  • RQ1深度、相机运动与光流之间的几何一致性能否作为无监督联合学习的强监督信号?
  • RQ2通过跨任务一致性联合训练深度与光流网络,是否能带来相较于独立训练或标准无监督方法的性能提升?
  • RQ3所提方法能否在无需在真实标签数据上微调的情况下,泛化到KITTI和Make3D等真实世界数据集?
  • RQ4与传统无监督损失(如光度损失和平滑性损失)相比,跨任务一致性损失在提升模型鲁棒性与准确性方面表现如何?
  • RQ5所学习的模型在有限标注数据的下游任务中,能在多大程度上作为有效的预训练模型?

主要发现

  • 所提出的DF-Net在KITTI 2012和2015光流基准上实现了最先进无监督性能,KITTI 2012的EPE为3.54,KITTI 2015的EPE为8.98,优于现有无监督方法。
  • 在KITTI 2012数据集上,该方法在无需任何微调的情况下实现EPE为3.54,即使在相同评估协议下,也优于某些有监督方法(如FlowNet2-ft-kitti,EPE为1.28)。
  • 深度预测模型在Make3D数据集上表现出色,证明其在无需领域特定微调的情况下可泛化至多样化场景。
  • 姿态估计网络在KITTI序列09上的平均平移误差为0.017 ± 0.007,在序列10上为0.015 ± 0.009,与最先进视觉SLAM方法相比表现相当。
  • 消融研究显示,若移除跨任务一致性损失,性能显著下降(KITTI 2012的EPE从3.54升至4.70),证实其关键作用。
  • 该方法泛化能力强:即使未在KITTI光流标注上微调,模型生成的物体轮廓也比有监督和无监督基线方法更清晰,如定性比较所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。