Skip to main content
QUICK REVIEW

[论文解读] Noise-Aware Unsupervised Deep Lidar-Stereo Fusion

Xuelian Cheng, Yiran Zhong|arXiv (Cornell University)|Apr 8, 2019
Advanced Vision and Imaging参考文献 34被引用 8
一句话总结

该论文提出 LidarStereoNet,一种无需真实深度图作为监督信号的无监督端到端深度学习框架,用于融合双目与激光雷达数据。通过引入反馈回路以处理噪声激光雷达点和传感器错位问题,并采用分段斜面拟合损失实现几何正则化,该方法在深度估计任务中达到最先进性能,显著优于现有双目匹配、深度补全及融合方法,即使在完全缺失激光雷达数据的情况下仍表现优异。

ABSTRACT

In this paper, we present LidarStereoNet, the first unsupervised Lidar-stereo fusion network, which can be trained in an end-to-end manner without the need of ground truth depth maps. By introducing a novel "Feedback Loop'' to connect the network input with output, LidarStereoNet could tackle both noisy Lidar points and misalignment between sensors that have been ignored in existing Lidar-stereo fusion studies. Besides, we propose to incorporate a piecewise planar model into network learning to further constrain depths to conform to the underlying 3D geometry. Extensive quantitative and qualitative evaluations on both real and synthetic datasets demonstrate the superiority of our method, which outperforms state-of-the-art stereo matching, depth completion and Lidar-Stereo fusion approaches significantly.

研究动机与目标

  • 解决现有激光雷达-双目融合方法依赖昂贵真实深度图进行训练的局限性。
  • 处理真实场景中激光雷达测量噪声及双目相机与激光雷达之间因校准误差或滚动快门效应导致的传感器错位问题。
  • 开发一种鲁棒的端到端无监督学习框架,使其在不同数据集和传感器配置下均具有良好泛化能力。
  • 通过分段斜面拟合损失引入强3D几何先验,以提升深度图质量。
  • 使网络在完全缺失激光雷达数据时仍能有效运行。

提出的方法

  • 提出一种新颖的“反馈回路”机制,将网络输入(激光雷达点)与输出(视差图)连接,实现在训练过程中迭代优化与噪声过滤。
  • 利用双目图像间的光度一致性以及双目与激光雷达之间的深度一致性作为无监督训练损失,从而无需真实深度监督。
  • 采用渐进式噪声去除策略,在训练过程中逐步过滤掉噪声激光雷达点,提升模型鲁棒性。
  • 引入分段斜面拟合损失以强制实现3D结构一致性,使视差图符合底层平面几何结构。
  • 采用后期融合策略,先分别处理双目与激光雷达输入,再在网络最后几层进行融合,提升特征兼容性。
  • 支持可变的激光雷达稀疏度,可在激光雷达完全缺失的极端情况下保持性能,依赖双目监督维持表现。

实验结果

研究问题

  • RQ1无监督深度学习框架能否在不依赖真实深度标注的情况下有效融合双目与激光雷达数据?
  • RQ2如何使网络对激光雷达点噪声及由校准误差或滚动快门效应引起的传感器错位具有鲁棒性?
  • RQ3分段平面结构等几何先验在激光雷达-双目融合中的深度估计中能带来多大程度的性能提升?
  • RQ4所提方法能否在具有不同噪声水平与稀疏度的现实世界与合成数据集上实现良好泛化?
  • RQ5反馈回路机制是否通过利用激光雷达输入迭代优化深度预测,显著提升模型性能?

主要发现

  • 在 KITTI 2015 数据集上,LidarStereoNet 实现了 0.0468 的绝对相对误差(Abs Rel),在关键指标上优于次佳方法超过2倍。
  • 在使用图像扭曲与平滑损失的基础上引入平面拟合损失后,误差率从 3.02% 降低至 2.73%,证明其在处理噪声输入方面的有效性。
  • 在 Synthia 数据集上,即使在噪声大且稀疏的视差输入下,该方法仍保持优异性能(Abs Rel: 0.0334),而 S2D 方法则出现显著性能下降。
  • 后期融合策略优于无融合与早期融合基线,Abs Rel 达到 0.0468,分别优于无融合(0.0555)与早期融合(0.0644)。
  • 该方法在未见场景中泛化良好,包括 Synthia 数据集中的低光照、雾霾与雨天条件,表现出在多种天气与光照条件下的稳定性能。
  • 即使激光雷达数据完全缺失,网络仍能通过仅双目监督保持有效性能,体现出其强大鲁棒性与适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。