Skip to main content
QUICK REVIEW

[论文解读] Multi-domain semantic segmentation with pyramidal fusion

Petra Bevandić, Marin Oršić|arXiv (Cornell University)|Sep 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 19被引用 4
一句话总结

该论文提出一种基于ResNet-152主干网络的多领域语义分割模型,采用金字塔特征融合机制,以处理具有不同类别分布的多样化数据集。该方法引入一种新颖的对数-求和概率损失函数,并结合边界感知的焦点加权机制,在分布外基准测试中达到最先进性能,包括在VIPER数据集上实现62.5%的mIoU,在WildDash 2上达到45.4%,同时在极少领域特定微调的情况下保持了跨领域的鲁棒性。

ABSTRACT

We present our submission to the semantic segmentation contest of the Robust Vision Challenge held at ECCV 2020. The contest requires submitting the same model to seven benchmarks from three different domains. Our approach is based on the SwiftNet architecture with pyramidal fusion. We address inconsistent taxonomies with a single-level 193-dimensional softmax output. We strive to train with large batches in order to stabilize optimization of a hard recognition problem, and to favour smooth evolution of batchnorm statistics. We achieve this by implementing a custom backward step through log-sum-prob loss, and by using small crops before freezing the population statistics. Our model ranks first on the RVC semantic segmentation challenge as well as on the WildDash 2 leaderboard. This suggests that pyramidal fusion is competitive not only for efficient inference with lightweight backbones, but also in large-scale setups for multi-domain application.

研究动机与目标

  • 开发一个单一深度学习模型,能够泛化于具有不同类别标签和分布的多个语义分割数据集。
  • 解决如ADE20K、Cityscapes、VIPER和ScanNet等数据集之间的领域偏移与类别模糊性问题。
  • 提升在分布外(OOD)数据上的性能,特别是在罕见类别或重叠类别场景下。
  • 设计一种损失函数,以增强模型对边界错误和类别重叠的鲁棒性。
  • 实现多尺度表示之间的有效特征融合,以提升分割精度。

提出的方法

  • 模型采用SwiftNet ResNet-152主干网络,并结合金字塔特征融合,以聚合多尺度上下文表征。
  • 通过合并、抽象或拆分数据集之间的重叠或子集类别,构建统一的通用类别集合,以统一语义空间。
  • 所提出的对数-求和概率损失函数将负对数似然与基于预测置信度和边界感知的指数加权相结合。
  • 损失函数采用动态加权方案:$ L^{ij} = -\alpha^{ij} e^{\gamma(1-p^{ij})} \log p^{ij} $,其中 $ p^{ij} $ 表示像素 $ (i,j) $ 在所有通用类别上的概率之和。
  • 通过类别级别上的合并与拆分解决冲突:完全匹配的类别进行合并,子集类别进行抽象,重叠类别则分解为互不相交的组件。
  • 训练采用数据增强(水平翻转、尺度抖动、裁剪)、使用余弦退火的Adam优化,以及在6× V100 GPU上进行梯度累积。

实验结果

研究问题

  • RQ1单一深度学习模型是否能在类别标签不一致的多个多样化语义分割数据集上实现优异性能?
  • RQ2如何解决类别级别上的冲突(如子集或重叠类别),以实现多领域语义分割的统一?
  • RQ3边界感知的对数-求和概率损失在提升分布外数据分割鲁棒性方面能发挥多大作用?
  • RQ4金字塔特征融合是否能增强多尺度上下文聚合,并提升跨领域设置下的泛化能力?
  • RQ5该模型在罕见或模糊类别上的表现如何,特别是在WildDash 2和WDv2等分布外场景下?

主要发现

  • 在VIPER数据集上,模型达到62.5%的mIoU,显著优于此前最先进方法(40.7%)在相同基准上的表现。
  • 在WildDash 2上,模型达到45.4%的mIoU,较次优方法(37.9%)高出7.5个百分点。
  • 模型展现出强大的OOD泛化能力,在MVD上仅有0.04%的像素被误分类(共455亿像素),表明其具有高度鲁棒性。
  • 在ScanNet上,模型达到54.6%的mIoU,较基线模型MSeg1080_RVC提升6.1%。
  • 模型保持了较高的推理速度,在早期训练阶段实现45 FPS的推理速度(输入分辨率为384×384)。
  • 损失函数有效减少了边界区域的错误,如在WildDash 2中负像素的IoU达到32.5%,表明其对模糊或罕见类别具有更好的处理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。