Skip to main content
QUICK REVIEW

[论文解读] Moving Indoor: Unsupervised Video Depth Learning in Challenging Environments

Junsheng Zhou, Yuwang Wang|arXiv (Cornell University)|Oct 20, 2019
Advanced Vision and Imaging参考文献 47被引用 10
一句话总结

本文提出了一种新颖的无监督视频深度学习框架,利用光流作为监督信号,以提升在具有挑战性的室内环境中的深度估计性能。通过引入一种稀疏到稠密的光流估计网络并优化姿态估计,该方法在 NYU Depth V2 基准上实现了与全监督方法相当的性能,标志着首次在室内数据集上实现纯无监督学习的定量结果。

ABSTRACT

Recently unsupervised learning of depth from videos has made remarkable progress and the results are comparable to fully supervised methods in outdoor scenes like KITTI. However, there still exist great challenges when directly applying this technology in indoor environments, e.g., large areas of non-texture regions like white wall, more complex ego-motion of handheld camera, transparent glasses and shiny objects. To overcome these problems, we propose a new optical-flow based training paradigm which reduces the difficulty of unsupervised learning by providing a clearer training target and handles the non-texture regions. Our experimental evaluation demonstrates that the result of our method is comparable to fully supervised methods on the NYU Depth V2 benchmark. To the best of our knowledge, this is the first quantitative result of purely unsupervised learning method reported on indoor datasets.

研究动机与目标

  • 为了解决现有无监督深度学习方法在室内环境中因缺乏纹理区域和复杂相机运动而失效的问题。
  • 通过使用光流作为比光度一致性更可靠的监督信号,降低无监督训练的难度。
  • 开发一种能够有效处理白色墙壁和反光表面等无纹理区域的鲁棒、稀疏到稠密的光流网络。
  • 改进手持相机序列中复杂自运动(尤其是纯旋转)的姿态估计。
  • 证明无监督深度学习在一般室内场景中是有效的,而不仅限于室外驾驶场景。

提出的方法

  • 提出一种新型训练范式,使用光流作为监督信号而非直接依赖光度一致性,从而降低训练不稳定性。
  • 设计一种稀疏到稠密的光流估计网络(SF-Net),通过基于CNN的精炼模块在图像中传播稀疏光流种子。
  • 引入一种过滤机制,移除仅包含纯旋转的图像对,防止网络在训练过程中崩溃。
  • 通过新型架构(F-PoseNet)增强PoseNet,使其更好地处理手持相机常见的复杂非前向运动。
  • 利用估计的光流联合监督DepthNet和PoseNet,从而提升深度预测的准确性。
  • 采用多阶段训练流程:首先在合成数据上预训练SF-Net,然后使用真实室内视频序列联合训练DepthNet和PoseNet。

实验结果

研究问题

  • RQ1在室内场景的无监督深度学习中,光流是否可作为比光度一致性更可靠的监督信号?
  • RQ2如何有效处理无纹理区域(如白色墙壁)在无监督深度估计中的问题?
  • RQ3手持相机序列中的纯旋转对无监督深度学习有何影响,如何缓解这一问题?
  • RQ4稀疏到稠密的光流估计网络是否能提升在具有挑战性的室内环境中的深度预测性能?
  • RQ5仅使用无监督视频学习,是否可能在室内数据集上实现与全监督方法相当的性能?

主要发现

  • 所提方法仅使用无监督视频学习,就在 NYU Depth V2 基准上实现了最先进性能,平均绝对误差(MAE)为 0.117,均方根误差(RMSE)为 0.234。
  • 消融实验证实,光流监督和纯旋转过滤对于防止室内设置下的训练崩溃至关重要。
  • SF-Net即使在无纹理区域也能生成高质量的光流预测,定性可视化结果表明其在白色墙壁和地毯上正确估计了光流。
  • 与标准PoseNet相比,F-PoseNet变体显著提升了姿态估计的准确性,尤其在复杂运动序列中表现更优。
  • 在 KITTI 数据集上,尽管光流精度成为瓶颈,该方法仍表现良好,表明其具备跨域可迁移性。
  • 该模型对大面积无纹理区域和复杂自运动表现出鲁棒性,在 NYU Depth V2 上实现了与全监督方法相当的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。