[论文解读] SCTNet: Single-Branch CNN with Transformer Semantic Information for Real-Time Segmentation
SCTNet 提出了一种用于实时语义分割的单分支卷积神经网络,通过在训练阶段引入一个仅用于训练的 Transformer 分支,将长距离上下文语义信息注入轻量级 CNN,采用一种新型的 CFBlock 和语义对齐模块。该方法在 Cityscapes、ADE20K 和 COCO-Stuff-10K 数据集上实现了最先进(SOTA)的精度-速度权衡,且在推理阶段无额外分支带来的计算开销。
Recent real-time semantic segmentation methods usually adopt an additional semantic branch to pursue rich long-range context. However, the additional branch incurs undesirable computational overhead and slows inference speed. To eliminate this dilemma, we propose SCTNet, a single branch CNN with transformer semantic information for real-time segmentation. SCTNet enjoys the rich semantic representations of an inference-free semantic branch while retaining the high efficiency of lightweight single branch CNN. SCTNet utilizes a transformer as the training-only semantic branch considering its superb ability to extract long-range context. With the help of the proposed transformer-like CNN block CFBlock and the semantic information alignment module, SCTNet could capture the rich semantic information from the transformer branch in training. During the inference, only the single branch CNN needs to be deployed. We conduct extensive experiments on Cityscapes, ADE20K, and COCO-Stuff-10K, and the results show that our method achieves the new state-of-the-art performance. The code and model is available at https://github.com/xzz777/SCTNet
研究动机与目标
- 通过消除双分支架构带来的计算开销,解决实时语义分割中的精度-速度权衡问题。
- 使轻量级单分支 CNN 在不牺牲推理速度的前提下学习丰富的长距离上下文信息。
- 在训练过程中弥合 CNN 与 Transformer 特征之间的语义鸿沟,以实现高效的知识蒸馏。
- 在保持实时推理性能的同时,在基准数据集上实现最先进(SOTA)的性能表现。
提出的方法
- 引入一个仅用于训练的 Transformer 分支,用于提取长距离上下文特征,这些特征在推理阶段不被使用。
- 提出 CFBlock(Conv-Former Block),一种基于 CNN 的模块,仅使用深度可分离卷积和逐点卷积来模拟自注意力机制,以捕捉长距离依赖关系。
- 设计语义信息对齐模块(SIAM),通过共享解码器头和特征优化,实现 Transformer 分支与 CNN 分支之间的特征对齐。
- 利用来自 Transformer 分支的知识蒸馏方法训练单分支 CNN,使其在不增加推理成本的前提下学习高层语义信息。
- 在推理阶段仅部署单分支 CNN,确保高效率和实时性能。
- 在解码器中采用特征共享和多尺度融合策略,以在整合全局上下文的同时保留空间细节。
实验结果
研究问题
- RQ1单分支 CNN 是否能在不依赖双分支架构的前提下,实现实时语义分割的最先进(SOTA)精度?
- RQ2基于 Transformer 的语义分支在训练阶段能否有效提升轻量级 CNN 的长距离上下文建模能力?
- RQ3在 CNN 与 Transformer 分支之间,哪种机制最有效地对齐特征以最小化语义鸿沟?
- RQ4所提出的方法是否能在保持实时推理速度的同时,超越现有的双分支实时模型?
主要发现
- SCTNet 在 Cityscapes 验证集上实现了新的最先进(SOTA)性能,确立了新的精度-速度前沿。
- 在 ADE20K 数据集上,SCTNet-B 生成的分割掩码更精细,对大面积目标的预测更准确,优于 SegFormer-B0、RTFormer-B、TopFormer-B 和 SeaFormer-B。
- 在 Cityscapes 上,SCTNet-B 在细小和薄型物体(如电线杆、交通信号灯和标志)的边界分割精度上优于 SeaFormer-B 和 STDC2。
- 该模型在 Cityscapes 上实现了 32.8 FPS 的推理速度,超过 30 FPS 的实时阈值,表明其具有出色的推理效率。
- 可视化结果表明,SCTNet 生成的分割掩码更加一致且细节更丰富,尤其在具有精细结构的复杂场景中表现更优。
- 消融实验验证了 CFBlock 和 SIAM 对性能的必要性,其中 SIAM 显著减小了分支之间的语义鸿沟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。