[论文解读] Squeeze-and-Attention Networks for Semantic Segmentation
本文提出Squeeze-and-Attention Networks(SANet),一种新颖的语义分割架构,将分割任务解耦为像素级预测与像素组注意力机制。通过引入一种Squeeze-and-Attention(SA)模块,该模块利用非局部、下采样的注意力图学习空间-通道依赖关系,SANet在不使用大量空洞卷积的情况下提升了特征表示能力,在PASCAL VOC上达到83.2%的mIoU,在PASCAL Context上达到54.4%的mIoU,且无需COCO预训练。
The recent integration of attention mechanisms into segmentation networks improves their representational capabilities through a great emphasis on more informative features. However, these attention mechanisms ignore an implicit sub-task of semantic segmentation and are constrained by the grid structure of convolution kernels. In this paper, we propose a novel squeeze-and-attention network (SANet) architecture that leverages an effective squeeze-and-attention (SA) module to account for two distinctive characteristics of segmentation: i) pixel-group attention, and ii) pixel-wise prediction. Specifically, the proposed SA modules impose pixel-group attention on conventional convolution by introducing an 'attention' convolutional channel, thus taking into account spatial-channel inter-dependencies in an efficient manner. The final segmentation results are produced by merging outputs from four hierarchical stages of a SANet to integrate multi-scale contexts for obtaining an enhanced pixel-wise prediction. Empirical experiments on two challenging public datasets validate the effectiveness of the proposed SANets, which achieves 83.2% mIoU (without COCO pre-training) on PASCAL VOC and a state-of-the-art mIoU of 54.4% on PASCAL Context.
研究动机与目标
- 为语义分割中长期被忽视的像素分组子任务提供解决方案,以补充像素级预测任务。
- 克服网格结构卷积核对空间特征学习的限制。
- 设计一种高效的注意力机制,以捕捉非局部空间依赖关系,而无需依赖复杂的空洞卷积。
- 在分层阶段中整合多尺度上下文特征,以提升密集预测性能。
- 开发一种轻量化但强大的分割网络,使其在各类基准测试中具备良好的泛化能力。
提出的方法
- 提出一种Squeeze-and-Attention(SA)模块,利用平均池化对特征图进行下采样,保留空间结构的同时生成注意力掩码。
- 引入注意力卷积,生成可学习权重,基于空间与通道依赖关系对特征通道进行重校准。
- 将SA模块作为头部单元集成到多阶段网络中,将其应用于来自四个分层主干网络阶段的输出。
- 采用空洞ResNet与EfficientNet作为主干网络,以利用其强大的特征提取能力。
- 聚合来自SA模块的多尺度特征,以增强目标边界检测与场景解析能力。
- 采用一种简单但高效的架构,避免使用EncNet等模型中的复杂模块,从而在保持性能的同时降低计算成本。
实验结果
研究问题
- RQ1语义分割能否被有效分解为两个独立的子任务:像素级预测与像素组注意力?
- RQ2如何设计注意力机制以在不依赖空洞卷积的情况下捕捉非局部空间依赖关系?
- RQ3轻量级注意力模块是否能在降低模型复杂度的同时提升分割性能?
- RQ4通过分层SA模块整合多尺度特征,是否能带来更优的边界与上下文理解?
- RQ5所提出的SANet是否能在无需COCO预训练的情况下,在具有挑战性的基准测试中实现最先进性能?
主要发现
- SANet在PASCAL VOC 2012上达到83.2%的mIoU,无需COCO预训练,优于RefineNet与PSPNet等先前模型。
- 在PASCAL Context上,SANet实现了54.4%的最先进mIoU,展现出在长尾分布与复杂场景中的强大泛化能力。
- 在COCO预训练下,SANet达到86.1%的mIoU,与PSPNet等顶尖模型性能相当,且优于使用更重ResNet101主干的RefineNet。
- SANet仅使用55.5M参数与204.7G MACs,显著少于SDN(238.5M参数)等重型模型,同时mIoU高于多个更大模型。
- 定性结果表明,SANet生成的物体边界更清晰,场景解析更准确,优于基线FCN及其他模型。
- SA模块计算效率高且效果显著,其在准确率与参数效率方面均优于EncNet的编码模块。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。