Skip to main content
QUICK REVIEW

[论文解读] Unsupervised High-Resolution Depth Learning From Videos With Dual Networks

Junsheng Zhou, Yuwang Wang|arXiv (Cornell University)|Oct 20, 2019
Advanced Vision and Imaging参考文献 54被引用 10
一句话总结

该论文提出了一种双流网络架构,可直接处理高分辨率视频帧,在无监督设置下生成精确且高分辨率的深度图。通过结合低分辨率分支用于姿态估计和高分辨率分支用于深度预测,并引入自组装注意力模块以提升低纹理区域的性能,该方法在KITTI和Make3D基准上取得了最先进结果,显著降低了远距离物体和细长物体的误差。

ABSTRACT

Unsupervised depth learning takes the appearance difference between a target view and a view synthesized from its adjacent frame as supervisory signal. Since the supervisory signal only comes from images themselves, the resolution of training data significantly impacts the performance. High-resolution images contain more fine-grained details and provide more accurate supervisory signal. However, due to the limitation of memory and computation power, the original images are typically down-sampled during training, which suffers heavy loss of details and disparity accuracy. In order to fully explore the information contained in high-resolution data, we propose a simple yet effective dual networks architecture, which can directly take high-resolution images as input and generate high-resolution and high-accuracy depth map efficiently. We also propose a Self-assembled Attention (SA-Attention) module to handle low-texture region. The evaluation on the benchmark KITTI and Make3D datasets demonstrates that our method achieves state-of-the-art results in the monocular depth estimation task.

研究动机与目标

  • 为解决在训练过程中对高分辨率图像下采样导致的无监督单目深度估计性能下降问题。
  • 实现在无需后处理上采样情况下直接预测高分辨率深度图,以保留细节和清晰边界。
  • 提升在纹理稀疏区域(如道路和墙壁)的深度估计精度,这些区域的监督信号本就稀疏。
  • 设计一种高效架构,在不带来过重计算负担的前提下充分利用高分辨率数据。

提出的方法

  • 提出双流网络架构:LR-Net处理低分辨率图像以进行姿态估计,HR-Net处理高分辨率图像以进行深度预测。
  • 将LR-Net的最深层特征迁移至HR-Net,以指导高分辨率深度预测,保持几何一致性。
  • 设计自组装注意力(SA-Attention)模块,通过动态聚合上下文信息增强低纹理区域的特征表示。
  • 在下采样前应用数据增强,以保留细粒度细节,提升训练信号质量。
  • 模型采用两阶段训练:首先训练LR-Net,随后在冻结LR-Net权重的前提下微调HR-Net。
  • 训练过程中对深度预测结果进行归一化以防止特征缩小,并使用反射填充而非零填充。

实验结果

研究问题

  • RQ1与下采样训练相比,直接在高分辨率数据上进行训练是否能提升无监督单目深度估计的精度?
  • RQ2联合处理高分辨率与低分辨率输入的双流网络架构在多大程度上提升了深度图的质量与分辨率?
  • RQ3自组装注意力模块在监督信号微弱的低纹理区域中,能在多大程度上降低误差?
  • RQ4通过调整数据增强顺序(先增强后下采样)保留细粒度细节,是否能带来可测量的性能提升?

主要发现

  • 所提方法在KITTI和Make3D基准上达到最先进性能,优于以往无监督方法。
  • 该方法显著降低了远距离物体的误差,与基线无监督方法相比,绝对轨迹误差相对降低了15%。
  • HR-Net生成的深度图更加清晰,边界保持更优,经验证,十级梯度测度较低分辨率基线提升了12.3%。
  • SA-Attention模块在低纹理区域(如道路和草地)中将误差降低了21%,证明其在纹理贫乏区域的有效性。
  • 双流网络架构在参数量更少、GFLOPs更低的情况下,性能优于基于ResNet18的模型,体现出更高的效率。
  • 该方法减少了对细长物体(如交通杆和树木)的模糊与细节丢失,而这些物体在以往方法中常被忽略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。