Skip to main content
QUICK REVIEW

[论文解读] Sparse and Dense Data with CNNs: Depth Completion and Semantic Segmentation

Maximilian Jaritz, Raoul de Charette|HAL (Le Centre pour la Communication Scientifique Directe)|Aug 2, 2018
Advanced Vision and Imaging参考文献 25被引用 16
一句话总结

本文提出一种基于CNN的新方法,用于在有或无密集RGB输入的情况下,利用稀疏深度数据进行深度补全和语义分割。该方法采用改进的NASNet架构和稀疏训练策略,无需使用有效性掩码。该方法在Kitti深度补全基准上达到最先进性能,即使在极低稀疏度(0.8%)下也表现优异,并展示了对稀疏深度与RGB数据的有效融合,用于语义分割。

ABSTRACT

Convolutional neural networks are designed for dense data, but vision data is often sparse (stereo depth, point clouds, pen stroke, etc.). We present a method to handle sparse depth data with optional dense RGB, and accomplish depth completion and semantic segmentation changing only the last layer. Our proposal efficiently learns sparse features without the need of an additional validity mask. We show how to ensure network robustness to varying input sparsities. Our method even works with densities as low as 0.8% (8 layer lidar), and outperforms all published state-of-the-art on the Kitti depth completion benchmark.

研究动机与目标

  • 解决在为密集输入设计的标准CNN中处理常见于激光雷达、立体视觉和点云中的稀疏深度数据的挑战。
  • 通过使网络能够自主学习对缺失数据不敏感的特征,克服现有稀疏CNN需要显式有效性掩码的局限性。
  • 在不预先生成密集深度图的前提下,有效融合稀疏深度与密集RGB数据,用于深度补全和语义分割。
  • 在不同输入稀疏度水平下实现鲁棒性能,包括极端情况如8层激光雷达(0.8%像素密度)。
  • 建立一种通用、轻量化且高效的稀疏数据处理框架,可通过极少的架构修改适配多种视觉任务。

提出的方法

  • 对预训练的NASNet编码器-解码器架构进行最小化修改,以处理稀疏输入,通过替换最后一层实现特定任务输出(深度回归或语义分割)。
  • 实施一种稀疏训练策略,使网络能够在不依赖显式有效性掩码输入的情况下,学习对缺失数据不敏感的特征。
  • 通过在解码器阶段拼接密集RGB与稀疏深度特征,实现晚期融合,使网络能够联合推理两种模态。
  • 使用标准损失函数进行训练:深度补全使用平均绝对误差(MAE),语义分割使用交叉熵损失。
  • 通过在训练和推理阶段保持一致的稀疏度分布,确保在不同稀疏度模式(结构化、块状、均匀)下的泛化能力。
  • 通过避免转置卷积,依赖跳跃连接和空洞卷积,保留边缘锐度和空间细节。

实验结果

研究问题

  • RQ1标准CNN是否能够在不依赖显式有效性掩码或专用稀疏卷积操作的情况下,稳健地处理稀疏深度数据?
  • RQ2随着输入稀疏度降低,深度补全与语义分割的性能如何退化?该方法在极低密度(如0.8%)下是否仍有效?
  • RQ3与早期融合或仅RGB基线相比,稀疏深度与密集RGB的晚期融合是否能提升语义分割精度?
  • RQ4相同的网络架构与训练策略是否可通过仅修改最后一层,有效复用于不同任务(深度补全与语义分割)?
  • RQ5该方法是否对不同稀疏度模式(如激光雷达的结构化、立体视觉的块状、合成数据的均匀)具有鲁棒性,而无需微调?

主要发现

  • 所提方法在Kitti深度补全基准上优于所有已发表的最先进方法,创下新的SOTA结果。
  • 即使仅使用8层激光雷达输入(0.8%像素密度),该模型仍能实现高质量的深度补全,生成视觉上合理且边缘清晰的深度图。
  • 在Synthia数据集上,RGB与稀疏深度的晚期融合实现了70.74%的平均IoU用于语义分割,显著优于仅RGB基线(63.47%)和早期融合(65.68%)。
  • 在Cityscapes数据集上,该方法通过晚期融合实现了57.82%的平均IoU,超越仅RGB基线(50.13%),并展现出对真实世界立体视觉深度数据的鲁棒性。
  • 网络在未显式引入掩码的情况下,隐式地处理了稀疏性,证明通过适当的训练,标准CNN可被有效适配于稀疏输入。
  • 定性结果表明,即使在大范围缺失数据区域,模型仍能保留细节与锐利边缘,并正确重建车道标记、建筑物等结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。