Skip to main content
QUICK REVIEW

[论文解读] ESNet: An Efficient Symmetric Network for Real-time Semantic Segmentation

Yu Wang, Quan Zhou|arXiv (Cornell University)|Jun 24, 2019
Advanced Neural Network Applications参考文献 38被引用 4
一句话总结

ESNet 提出了一种轻量级、对称的编码器-解码器网络,用于实时语义分割,其核心是新颖的并行分解卷积单元(PFCU),该单元采用变换-拆分-变换-合并策略,在保持特征表示能力的同时降低计算成本。仅使用 1.6M 参数,它在单张 GTX 1080Ti 上实现了 62 FPS 的推理速度,并在 CityScapes 数据集上实现了新的最先进精度-效率权衡,优于以往的轻量级模型,在速度和 mIOU 分数上均表现更优。

ABSTRACT

The recent years have witnessed great advances for semantic segmentation using deep convolutional neural networks (DCNNs). However, a large number of convolutional layers and feature channels lead to semantic segmentation as a computationally heavy task, which is disadvantage to the scenario with limited resources. In this paper, we design an efficient symmetric network, called (ESNet), to address this problem. The whole network has nearly symmetric architecture, which is mainly composed of a series of factorized convolution unit (FCU) and its parallel counterparts (PFCU). On one hand, the FCU adopts a widely-used 1D factorized convolution in residual layers. On the other hand, the parallel version employs a transform-split-transform-merge strategy in the designment of residual module, where the split branch adopts dilated convolutions with different rate to enlarge receptive field. Our model has nearly 1.6M parameters, and is able to be performed over 62 FPS on a single GTX 1080Ti GPU. The experiments demonstrate that our approach achieves state-of-the-art results in terms of speed and accuracy trade-off for real-time semantic segmentation on CityScapes dataset.

研究动机与目标

  • 为解决在无人机、机器人和智能手机等资源受限设备上部署高精度语义分割模型的挑战。
  • 在不牺牲分割精度的前提下,降低计算复杂度和模型大小,尤其适用于实时推理。
  • 设计一种对称且高效的架构,通过新颖的残差块设计保持高特征表示能力。
  • 与现有轻量级网络相比,实现速度、精度和模型紧凑性之间的更优平衡。

提出的方法

  • 网络采用基于残差块的近似对称编码器-解码器架构,通过下采样和上采样单元构建特征层次。
  • 核心组件是并行分解卷积单元(PFCU),其通过变换-拆分-变换-合并策略,将二维卷积分解为多条并行路径上的 1D 分解卷积。
  • PFCU 集成身份捷径和多路径 1D 卷积,采用不同的空洞率以扩展感受野,同时减少 FLOPs。
  • 分解卷积单元(FCU)使用自适应核大小的 1D 分解卷积,高效捕捉多尺度特征。
  • 该架构端到端可训练,可直接应用于现有的基于 ResNet 的分割和分类网络。
  • 该设计显著减少参数量并加快推理速度,同时仅造成极小的精度损失。

实验结果

研究问题

  • RQ1对称的轻量级网络架构是否能在边缘设备上实现高分割精度,同时保持实时推理速度?
  • RQ2PFCU 中的变换-拆分-变换-合并策略相比标准 2D 卷积如何提升特征表示效率?
  • RQ3在使用分解和并行卷积设计时,模型大小、推理速度和分割 mIOU 之间的权衡如何?
  • RQ4与 ENet、ESPNet 和 CGNet 等最先进轻量级网络相比,ESNet 在精度和速度方面表现如何?

主要发现

  • 在单张 GTX 1080Ti GPU 上,ESNet 仅使用 160 万个参数,实现 62 FPS 的推理速度,显著优于 SegNet 在速度和模型大小方面的表现。
  • 在 CityScapes 验证集上,ESNet 在无数据增强条件下实现 69.1% 的类别 mIOU 和 69.1% 的类别 mIOU,与 ICNet 性能相当,类别 mIOU 低 0.4%,但类别 mIOU 更高。
  • 在增加 20,000 个粗粒度标注后,ESNet 实现 70.7% 的类别 mIOU 和 87.4% 的类别 mIOU,创下精度-效率权衡的新最先进结果。
  • ESNet 的推理速度接近 SegNet 的 4 倍,模型大小小 18 倍;尽管参数量是 ENet 的 5 倍,但其类别 mIOU 和类别 mIOU 分别高出 12.4% 和 7%。
  • 可视化结果表明,ESNet 在不同物体尺度上泛化能力良好,尤其在检测小物体(如交通标志和交通灯)方面表现更优。
  • PFCU 设计实现了高效的推理,显著降低 FLOPs,对称架构简化了训练和推理过程,同时保持高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。