Skip to main content
QUICK REVIEW

[论文解读] GeoNet: Unsupervised Learning of Dense Depth, Optical Flow and Camera Pose

Zhichao Yin, Jianping Shi|arXiv (Cornell University)|Mar 6, 2018
Advanced Vision and Imaging参考文献 39被引用 122
一句话总结

GeoNet 在无监督、几何驱动的框架中从视频中联合学习单目深度、光流和 ego-motion,使用两阶段级联和自适应几何一致性来处理动态区域和遮挡;在 KITTI 数据集上实现了无监督方法中的最先进性能,接近有监督方法。

ABSTRACT

We propose GeoNet, a jointly unsupervised learning framework for monocular depth, optical flow and ego-motion estimation from videos. The three components are coupled by the nature of 3D scene geometry, jointly learned by our framework in an end-to-end manner. Specifically, geometric relationships are extracted over the predictions of individual modules and then combined as an image reconstruction loss, reasoning about static and dynamic scene parts separately. Furthermore, we propose an adaptive geometric consistency loss to increase robustness towards outliers and non-Lambertian regions, which resolves occlusions and texture ambiguities effectively. Experimentation on the KITTI driving dataset reveals that our scheme achieves state-of-the-art results in all of the three tasks, performing better than previously unsupervised methods and comparably with supervised ones.

研究动机与目标

  • 在没有地面真实标签的单目视频中,激励学习三维场景几何。
  • 将场景运动分解为刚性(深度+ego-motion)和非刚性(物体运动)分量。
  • 强制几何一致性,以稳健处理遮挡和非朗伯区域。
  • 提出一个端到端的两阶段架构,以改进无监督的深度、光流和位姿估计。
  • 在 KITTI 上评估,显示出与监督方法竞争的性能。

提出的方法

  • 两阶段级联架构:第一阶段为刚性结构重建器(DepthNet + PoseNet),用于估计深度和相机运动,产生刚性光流;第二阶段为 ResFlowNet,学习残差非刚性光流并细化完整光流。
  • 端到端可微分的视图合成损失,将合成视图与目标帧进行比较(光度损失,结合 SSIM 和 L1)。
  • 边缘感知的深度平滑损失,在保持细节的同时,在无纹理区域鼓励深度平滑。
  • 自适应几何一致性损失,模拟前向-后向一致性,选择性地在非遮挡区域强制一致性,以缓解遮挡和非朗伯效应。
  • 联合损失 L = 对各尺度和帧对求和:L_rw + lambda_ds*L_ds + L_fw + lambda_fs*L_fs + lambda_gc*L_gc。

实验结果

研究问题

  • RQ1是否可以在无监督的条件下,基于视频联合学习单目深度、光流和 ego-motion?
  • RQ2如何将静态和动态场景分量分离并加以利用,以提高对遮挡和非朗伯区域的鲁棒性?
  • RQ3在无监督学习中,强制自适应几何一致性是否提高深度、光流和位姿的预测质量?
  • RQ4在 KITTI 上,两阶段架构(刚性结构与非刚性运动)的取舍及性能提升是什么?

主要发现

  • GeoNet 在 KITTI 上的深度、光流和相机位姿估计方面达到无监督方法中的最新水平。
  • 两阶段架构(DepthNet + PoseNet,随后为 ResFlowNet)有效地分解刚性和非刚性运动,提升整体预测。
  • 自适应几何一致性损失通过在非遮挡区域选择性地强制预测一致性,提高对遮挡和纹理模糊的鲁棒性。
  • 在 KITTI 上,GeoNet 的无监督深度估计和位姿估计与有监督方法竞争力十足,且其光流结果超越了先前的无监督基线。
  • 消融研究表明几何一致性和残差光流在处理动态物体和挑战性区域(遮挡、光照)方面的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。