[论文解读] DSNet: A Novel Way to Use Atrous Convolutions in Semantic Segmentation
DSNet 提出了一种新颖的双分支CNN架构,在网络的浅层应用空洞卷积,遵循三项经验性原则:结合空洞卷积与密集卷积,通过最优率选择避免‘空洞灾难’,并使用有效的融合机制。该模型在Cityscapes上实现了80.4% mIOU与81.9 FPS的SOTA精度-速度平衡,在ADE20K上实现了40.0% mIOU与179.2 FPS的性能,优于所有实时的基于Transformer和基于CNN的模型。
Atrous convolutions are employed as a method to increase the receptive field in semantic segmentation tasks. However, in previous works of semantic segmentation, it was rarely employed in the shallow layers of the model. We revisit the design of atrous convolutions in modern convolutional neural networks (CNNs), and demonstrate that the concept of using large kernels to apply atrous convolutions could be a more powerful paradigm. We propose three guidelines to apply atrous convolutions more efficiently. Following these guidelines, we propose DSNet, a Dual-Branch CNN architecture, which incorporates atrous convolutions in the shallow layers of the model architecture, as well as pretraining the nearly entire encoder on ImageNet to achieve better performance. To demonstrate the effectiveness of our approach, our models achieve a new state-of-the-art trade-off between accuracy and speed on ADE20K, Cityscapes and BDD datasets. Specifically, DSNet achieves 40.0% mIOU with inference speed of 179.2 FPS on ADE20K, and 80.4% mIOU with speed of 81.9 FPS on Cityscapes. Source code and models are available at Github: https://github.com/takaniwa/DSNet.
研究动机与目标
- 重新评估空洞卷积在语义分割中的应用,特别是其在CNN中浅层中被低估的潜力。
- 识别并形式化有效应用空洞卷积的经验证据准则,解决先前工作中观察到的局限性。
- 设计一种双分支、同分辨率的网络(DSNet),利用这些准则提升实时与高精度分割任务的性能。
- 在ADE20K、Cityscapes和BDD等基准数据集上实现SOTA性能,平衡mIOU与推理速度。
提出的方法
- 作者提出了三项经验性准则:(1) 使用空洞卷积与密集卷积的结合,而非仅使用空洞卷积;(2) 精确选择空洞率以避免性能下降(即‘空洞灾难’);(3) 使用有效的融合机制整合多尺度特征。
- DSNet是一种双分支CNN架构,包含两个并行分支:一个上下文分支使用堆叠的大核空洞卷积,一个空间分支使用标准卷积,两者在整个网络中保持相同分辨率。
- 网络采用多尺度融合空洞卷积分块(MFACB)、多尺度注意力融合模块(MSAF)和串行-并行空洞空间金字塔池化模块(SPASPP),以增强特征表示与融合能力。
- 整个编码器在ImageNet上进行预训练,提升了特征学习与泛化能力,尤其在应用空洞卷积的浅层中表现更优。
- 模型采用标准的编码器-解码器结构并引入跳跃连接,双分支特征被拼接后上采样,用于最终的语义分割预测。
- 性能在ADE20K、Cityscapes和BDD数据集上,基于标准单尺度推理协议,通过mIOU与FPS进行评估。
实验结果
研究问题
- RQ1哪些关键因素限制了空洞卷积在CNN浅层中用于语义分割的有效应用?
- RQ2如何以最大化感受野扩展的方式应用空洞卷积,同时避免特征质量下降?
- RQ3在浅层中结合空洞卷积与密集卷积是否能带来优于单独使用任一方法的性能提升?
- RQ4当空洞卷积应用于网络早期阶段时,ImageNet预训练起到了何种作用?
- RQ5在上下文分支中应用空洞卷积的双分支、同分辨率架构,是否能超越现有实时与高精度模型?
主要发现
- DSNet在Cityscapes上以2048×1024分辨率实现了80.4% mIOU与81.9 FPS,创下实时语义分割的新SOTA纪录。
- 在ADE20K上,DSNet实现了40.0% mIOU与179.2 FPS,展示了在高精度基准中优异的精度-速度平衡。
- DSNet-Base在Cityscapes上达到82.0% mIOU,优于高精度模型HRNetV2-W48(81.1%)与OCRNet(81.6%),且参数量更少(37.5M)。
- 与SFNet(ResNet18)相比,DSNet在推理速度更快的同时mIOU高出2.2%;与SFNet-Lite(STDC-2)相比,mIOU高出3.4%,仅增加0.3ms延迟。
- 消融实验验证了所提准则——空洞与密集卷积结合、最优空洞率选择、合理融合机制——对性能的显著提升作用。
- 结果表明,当遵循恰当的设计原则时,在浅层应用空洞卷积可实现更优的特征学习与分割精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。