Skip to main content
QUICK REVIEW

[论文解读] LRNNet: A Light-Weighted Network with Efficient Reduced Non-Local Operation for Real-Time Semantic Segmentation

Weihao Jiang, Zhaozhi Xie|arXiv (Cornell University)|Jun 4, 2020
Advanced Neural Network Applications参考文献 22被引用 7
一句话总结

LRNNet 提出了一种轻量级、实时的语义分割网络,采用分解卷积模块(FCB)实现高效特征提取,并基于区域奇异向量提出一种简化非局部模块(SVN),以极低的计算成本建模长距离依赖关系。该方法在 Cityscapes 数据集上实现了 72.2% 的 mIoU,参数量仅 0.68M,且在 GTX 1080Ti 上达到 71 FPS,创下准确率、速度、模型大小与效率之间新的最先进平衡。

ABSTRACT

The recent development of light-weighted neural networks has promoted the applications of deep learning under resource constraints and mobile applications. Many of these applications need to perform a real-time and efficient prediction for semantic segmentation with a light-weighted network. This paper introduces a light-weighted network with an efficient reduced non-local module (LRNNet) for efficient and realtime semantic segmentation. We proposed a factorized convolutional block in ResNet-Style encoder to achieve more lightweighted, efficient and powerful feature extraction. Meanwhile, our proposed reduced non-local module utilizes spatial regional dominant singular vectors to achieve reduced and more representative non-local feature integration with much lower computation and memory cost. Experiments demonstrate our superior trade-off among light-weight, speed, computation and accuracy. Without additional processing and pretraining, LRNNet achieves 72.2% mIoU on Cityscapes test dataset only using the fine annotation data for training with only 0.68M parameters and with 71 FPS on a GTX 1080Ti card.

研究动机与目标

  • 开发一种适用于移动设备和资源受限环境的轻量级、实时语义分割网络。
  • 通过设计一种分解卷积模块(FCB),分别处理短程与长程特征,提升特征提取效率。
  • 在保持全局上下文建模能力的同时,降低非局部操作的计算与内存开销。
  • 在模型大小、推理速度、计算成本与分割准确率之间实现更优的权衡。

提出的方法

  • 所提出的分解卷积模块(FCB)利用深度可分离卷积与通道分解,减少参数量与计算量,同时保持强大的特征表示能力。
  • 简化非局部模块(SVN)通过区域主导奇异向量提取空间区域的代表性特征,减少键与值的数量,降低计算复杂度。
  • SVN 模块采用幂迭代方法高效计算主导奇异向量,实现在无需完整成对注意力的情况下,低开销地整合全局特征。
  • 编码器采用基于 ResNet 风格的架构,由 FCB 构建而成;解码器则引入 SVN 模块,利用全局上下文细化特征。
  • 网络通过仅使用 Cityscapes 和 CamVid 的精细标注数据端到端训练,无需预训练或数据增强。
  • 通过在标准基准上的推理速度(FPS)、参数量(Para)与 FLOPS(GFLOPS)评估模型效率。

实验结果

研究问题

  • RQ1分解卷积模块能否在轻量级网络中有效平衡短程与长程特征学习?
  • RQ2基于区域奇异向量的简化非局部模块能否在显著降低计算成本的前提下,实现与完整非局部操作相当的全局上下文建模能力?
  • RQ3将此类模块集成到轻量级编码器-解码器架构中,是否能实现准确率、速度与模型大小方面的最先进性能?
  • RQ4所提出的网络能否在不使用预训练或额外数据处理的情况下,实现在 Cityscapes 与 CamVid 上的高准确率?

主要发现

  • LRNNet 在 Cityscapes 测试集上实现 72.2% 的 mIoU,参数量仅 0.68M,且在 GTX 1080Ti 上达到 71 FPS,展现出效率与准确率之间新的最先进权衡。
  • 单尺度 SVN(Model B)相比基于池化的方法提升 mIoU 0.5%,达到 71.6% mIoU,计算量仅小幅增加至 8.57 GFLOPS。
  • 多尺度 SVN(Model C)进一步将 Cityscapes 上的性能提升至 72.2% mIoU,同时保持高推理速度与低参数量。
  • 在 CamVid 数据集上,LRNNet 实现 69.2% mIoU,参数量为 0.68M,推理速度达 76.5 FPS,展现出优异的跨数据集泛化能力。
  • 基于 FCB 的编码器在减小模型大小与计算量的同时,优于 ERFNet 与 LEDNet 在准确率与效率方面的表现。
  • SVN 中使用区域主导奇异向量,相比最大池化或平均池化,能提供更具代表性的特征,尤其在轻量级设置下优势更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。