[论文解读] FDDWNet: A Lightweight Convolutional Neural Network for Real-time Sementic Segmentation
FDDWNet 是一种轻量级、深层的编码器-解码器卷积神经网络,适用于实时语义分割,通过使用分解扩张深度可分离卷积(FDDWC)和多分支跳跃连接,在参数极少的情况下实现高精度。其在 CityScapes 数据集上实现了 60 FPS 的推理速度和 71.5% 的 mIoU,参数量仅为 0.8M,优于以往的轻量级模型在速度-精度权衡方面的表现。
This paper introduces a lightweight convolutional neural network, called FDDWNet, for real-time accurate semantic segmentation. In contrast to recent advances of lightweight networks that prefer to utilize shallow structure, FDDWNet makes an effort to design more deeper network architecture, while maintains faster inference speed and higher segmentation accuracy. Our network uses factorized dilated depth-wise separable convolutions (FDDWC) to learn feature representations from different scale receptive fields with fewer model parameters. Additionally, FDDWNet has multiple branches of skipped connections to gather context cues from intermediate convolution layers. The experiments show that FDDWNet only has 0.8M model size, while achieves 60 FPS running speed on a single RTX 2080Ti GPU with a 1024x512 input image. The comprehensive experiments demonstrate that our model achieves state-of-the-art results in terms of available speed and accuracy trade-off on CityScapes and CamVid datasets.
研究动机与目标
- 解决边缘设备上实时应用中模型效率与分割精度之间的权衡问题。
- 设计一种更深的轻量级网络架构,在保持快速推理速度的同时提升特征表示能力。
- 在不牺牲分割性能的前提下减小模型大小和计算成本。
- 探索使用分解扩张深度可分离卷积(FDDWC)以更少的参数实现多尺度感受野学习。
- 通过引入来自中间层的多条跳跃连接,增强上下文聚合能力和模型鲁棒性。
提出的方法
- 提出极高效的残差模块(EERM),利用分解扩张深度可分离卷积(FDDWC),在减少参数量的同时保持高表征能力。
- 通过将标准卷积分解为两个一维分解的深度可分离卷积(带扩张),再接 1×1 点卷积,实现 FDDWC。
- 引入来自中间层的多分支跳跃连接,以聚合上下文特征并改善梯度流动。
- 采用端到端可训练架构,并在 EERM 中使用恒等映射,防止梯度消失/爆炸。
- 在 CityScapes 和 CamVid 数据集上,采用带动量和权重衰减的 'poly' 学习率策略,实现稳定训练。
- 通过使用小批量大小(4)和高效层设计优化推理速度,在单张 RTX 2080Ti 上实现 60 FPS。
实验结果
研究问题
- RQ1更深的轻量级网络架构是否能在不增加模型大小或推理延迟的情况下实现更高的分割精度?
- RQ2分解扩张深度可分离卷积(FDDWC)在以更少参数学习多尺度特征方面的有效性如何?
- RQ3来自中间层的多分支跳跃连接对实时分割中上下文聚合和性能的影响是什么?
- RQ4在标准基准上,FDDWNet 与最先进轻量级模型相比,在速度-精度权衡方面表现如何?
- RQ5一个参数量为 0.8M 的轻量级网络是否能在不使用数据增强或后处理的情况下,在 CityScapes 和 CamVid 上实现最先进性能?
主要发现
- FDDWNet 在 CityScapes 验证集上达到 71.5% 的 mIoU,优于大多数现有轻量级模型。
- 在单张 RTX 2080Ti GPU 上,输入为 1024×512 时,推理速度达 60 FPS,展现出实时推理能力。
- 模型仅含 0.8M 参数,相比 ICNet 小 53 倍,且接近 2 倍快。
- 在 CityScapes 的 19 个类别中,FDDWNet 在 13 个类别上取得最佳 mIoU,其中 'Wall' 类提升 6.1%,'Pedestrian' 类提升 2.7%。
- 在 CamVid 上,FDDWNet 达到 66.9% mIoU,推理速度为 79 FPS,相比 ICNet 在速度上更优,仅损失 0.2% 准确率。
- 尽管网络更深,FDDWNet 的模型大小与 DABNet 相当,但深度接近其 2 倍,表明其参数效率更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。