Skip to main content
QUICK REVIEW

[论文解读] Dilated SpineNet for Semantic Segmentation

Abdullah Rashwan, Xianzhi Du|arXiv (Cornell University)|Mar 23, 2021
Advanced Neural Network Applications参考文献 53被引用 6
一句话总结

该论文提出Dilated SpineNet(SpineNet-Seg),一种通过神经架构搜索(NAS)发现的语义分割主干网络,通过整合尺度置换特征融合与空洞卷积,以保持空间分辨率并增强多尺度特征学习。该方法在Cityscapes(83.04% mIoU)和PASCAL VOC2012(85.56% mIoU)上实现了最先进性能,采用单模型、单尺度推理,优于所有模型尺度下的DeepLabv3/v3+基线模型,同时参数量和FLOPs更少。

ABSTRACT

Scale-permuted networks have shown promising results on object bounding box detection and instance segmentation. Scale permutation and cross-scale fusion of features enable the network to capture multi-scale semantics while preserving spatial resolution. In this work, we evaluate this meta-architecture design on semantic segmentation - another vision task that benefits from high spatial resolution and multi-scale feature fusion at different network stages. By further leveraging dilated convolution operations, we propose SpineNet-Seg, a network discovered by NAS that is searched from the DeepLabv3 system. SpineNet-Seg is designed with a better scale-permuted network topology with customized dilation ratios per block on a semantic segmentation task. SpineNet-Seg models outperform the DeepLabv3/v3+ baselines at all model scales on multiple popular benchmarks in speed and accuracy. In particular, our SpineNet-S143+ model achieves the new state-of-the-art on the popular Cityscapes benchmark at 83.04% mIoU and attained strong performance on the PASCAL VOC2012 benchmark at 85.56% mIoU. SpineNet-Seg models also show promising results on a challenging Street View segmentation dataset. Code and checkpoints will be open-sourced.

研究动机与目标

  • 评估尺度置换网络(此前在检测任务中表现优异)在语义分割任务中的有效性,该任务需要高空间分辨率和多尺度上下文信息。
  • 为NAS设计一个联合搜索空间,联合优化尺度置换、跨尺度连接、模块深度调整和空洞率,以适配语义分割任务。
  • 为常规和移动端语义分割开发高效且高性能的模型,超越现有基线模型在准确率与效率上的表现。
  • 在不使用额外训练数据或多尺度推理的前提下,实现在主要基准测试上的最先进性能。

提出的方法

  • 作者通过使用下采样后的ImageNet风格图像(384×384)和降低的特征维度,设计了一个代理任务以加速神经架构搜索。
  • 提出一种新型搜索空间,联合优化四个组件:尺度置换连接、跨尺度特征融合、模块深度调整以及每层的空洞率。
  • 使用PASCAL VOC2012验证集的mIoU作为奖励信号,训练NAS控制器,结合代理任务以实现对10,000个候选架构的快速评估。
  • 最终架构SpineNet-S49被扩展为SpineNet-S143+以实现高精度分割,并进一步优化为Mobile SpineNet-Seg以实现高效推理。
  • 在搜索到的架构中集成空洞卷积,以在不降低空间分辨率的前提下保持大感受野。
  • 采用改进的DeepLabv3主干网络作为搜索基线,NAS过程中将输出步长调整为8,以最大化性能增益。

实验结果

研究问题

  • RQ1尺度置换网络(在目标检测中表现优异)能否成功迁移至语义分割任务,以提升性能?
  • RQ2联合搜索尺度置换连接、跨尺度融合、模块深度与空洞率,是否能优于独立搜索或固定设计,从而获得更优的语义分割模型?
  • RQ3通过代理任务进行NAS,能否在降低计算成本的同时实现在语义分割基准上的高性能?
  • RQ4最终架构是否在标准基准上超越现有最先进模型(如DeepLabv3/v3+),实现单模型、单尺度推理下的最先进性能?
  • RQ5所搜索到的架构能否有效扩展,以同时支持高精度与移动端优化的语义分割?

主要发现

  • SpineNet-S143+在Cityscapes基准上以单模型、单尺度推理实现83.04% mIoU的新最先进性能,且未使用额外训练数据。
  • 在PASCAL VOC2012上,SpineNet-S143+达到85.56% mIoU,较DeepLabv3/v3+基线模型提升2.47% mIoU,同时FLOPs减少15%。
  • 移动端优化的SpineNet-S49-模型在mIoU上较基于MobileNetV3的DeepLab模型提升+2.5%,且计算成本更低。
  • 使用COCO Things标注的NAS代理任务表现最佳,在PASCAL VOC2012上较基线模型实现+2.47% mIoU增益。
  • 消融实验表明,联合搜索尺度置换网络与空洞率可带来+2.47% mIoU增益,且输出步长为8时表现最优。
  • 当以ResNet-S50作为搜索基线时,该方法相较基线DeepLabv3实现+2.06% mIoU增益,证明了NAS方法的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。