Skip to main content
QUICK REVIEW

[论文解读] Robust Semantic Segmentation with Ladder-DenseNet Models

Ivan Krešo, Marin Oršić|arXiv (Cornell University)|Jun 9, 2018
Advanced Neural Network Applications参考文献 13被引用 8
一句话总结

本文提出一种改进的级联式DenseNet-169模型,采用修改后的上采样路径和一种新型金字塔损失函数,以实现跨多种数据集的鲁棒语义分割。通过在Cityscapes、ScanNet、KITTI和WildDash上联合训练,该模型在所有四个基准测试中均达到最先进性能,其中在WildDash上的mIoU为59.6%,在Cityscapes上的mIoU为77.1%,表明通过多数据集训练可显著提升模型泛化能力与分布外检测性能。

ABSTRACT

We present semantic segmentation experiments with a model capable to perform predictions on four benchmark datasets: Cityscapes, ScanNet, WildDash and KITTI. We employ a ladder-style convolutional architecture featuring a modified DenseNet-169 model in the downsampling datapath, and only one convolution in each stage of the upsampling datapath. Due to limited computing resources, we perform the training only on Cityscapes Fine train+val, ScanNet train, WildDash val and KITTI train. We evaluate the trained model on the test subsets of the four benchmarks in concordance with the guidelines of the Robust Vision Challenge ROB 2018. The performed experiments reveal several interesting findings which we describe and discuss.

研究动机与目标

  • 开发一种对多样化真实环境中的分布偏移具有鲁棒性的语义分割模型。
  • 探究在不同领域(城市、室内、室外)的多个数据集上同时训练是否能提升模型泛化能力与不确定性检测性能。
  • 评估辅助损失与网络结构改进在减少深层上采样路径中误差传播方面的有效性。
  • 评估小批量组成与跨数据集训练对模型收敛性与性能的影响。

提出的方法

  • 在下采样路径中使用修改后的DenseNet-169主干网络,所有上采样路径中的连接操作均替换为求和操作,以提升效率并保持IoU精度。
  • 上采样路径中每个阶段仅使用一个卷积层,并将滤波器数量从128增加至256,以防止在多数据集训练中出现欠拟合。
  • 在下采样路径中,使用空间金字塔池化模块替代上下文层,以增强多尺度特征表示能力。
  • 引入一种新型金字塔损失作为辅助损失,替代原有的辅助损失,以稳定训练过程并提升特征学习效果。
  • 采用跨数据集的小批量进行训练,以提升批量归一化稳定性与收敛性。
  • 通过双线性插值将模型预测结果上采样至输入分辨率,并使用交叉熵损失与独热编码的真实标签进行优化。

实验结果

研究问题

  • RQ1单一语义分割模型是否能在Cityscapes、ScanNet、KITTI和WildDash等多样化、分布外的数据集上实现优异性能?
  • RQ2多数据集训练在多大程度上影响模型的泛化能力与对分布偏移的鲁棒性?
  • RQ3通过求和方式实现的上采样路径与金字塔损失等结构改进,能在多大程度上减少深层上采样路径中的误差累积?
  • RQ4在验证集中引入分布外数据(如WildDash)是否能提升模型检测异常或损坏图像区域的能力?
  • RQ5小批量组成如何影响多领域语义分割训练中的稳定性与收敛性?

主要发现

  • 在Cityscapes上,模型达到77.1%的类别IoU,在ROB 2018挑战赛中排名第二;在KITTI上达到63.5%的类别IoU,排名第三。
  • 在WildDash上,模型实现54.5%的类别IoU,显著提升了对模糊或失真图像块等分布外区域的检测能力。
  • 仅在ScanNet上进行训练,即可提升模型在WildDash测试集中对分布外像素的识别能力,许多此类像素被正确分类为ScanNet类别,表明OOD检测能力得到增强。
  • 金字塔损失有效减少了上采样路径中的误差传播,尽管在更高分辨率下仍观察到一定程度的过拟合。
  • 跨数据集小批量训练提升了收敛性与稳定性,可能归因于跨领域更优的批量归一化统计量。
  • 模型在分布内样本上的混淆极低:约10亿个ScanNet测试像素中仅有8个被误分类为Cityscapes类别,反之亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。