[论文解读] Attention-based Dual Supervised Decoder for RGBD Semantic Segmentation
本文提出了一种基于注意力机制的双分支监督解码器用于RGBD语义分割,通过在编码器和解码器中增强特征融合,提升了跨模态表征学习与训练收敛性,在NYUDv2(52.5% mIoU)和SUN-RGBD(62.1% mAcc.)数据集上实现了最先进性能。
Encoder-decoder models have been widely used in RGBD semantic segmentation, and most of them are designed via a two-stream network. In general, jointly reasoning the color and geometric information from RGBD is beneficial for semantic segmentation. However, most existing approaches fail to comprehensively utilize multimodal information in both the encoder and decoder. In this paper, we propose a novel attention-based dual supervised decoder for RGBD semantic segmentation. In the encoder, we design a simple yet effective attention-based multimodal fusion module to extract and fuse deeply multi-level paired complementary information. To learn more robust deep representations and rich multi-modal information, we introduce a dual-branch decoder to effectively leverage the correlations and complementary cues of different tasks. Extensive experiments on NYUDv2 and SUN-RGBD datasets demonstrate that our method achieves superior performance against the state-of-the-art methods.
研究动机与目标
- 为解决在语义分割中有效融合多模态RGB与深度信息的挑战。
- 通过引入双分支解码器架构,克服编码器与解码器之间训练不平衡的问题。
- 通过来自相关任务的辅助监督实现多任务蒸馏,提升分割性能。
- 通过利用多尺度上的跨模态相关性,增强特征表示学习。
提出的方法
- 在编码器中引入基于注意力机制的多模态融合(AMF)模块,以从RGB与深度流中提取并融合深层、多层级的配对互补特征。
- 采用双分支解码器,其中主分支通过ASPP实现多尺度上下文建模以完成语义分割,而辅助分支则提供任务引导的监督(如法向估计或深度估计)。
- 在主分支中引入金字塔监督,以增强深层表征学习并提高边界精度。
- 采用两阶段训练策略:先使用深度或法向引导的辅助分支进行预训练,再通过语义引导监督进行微调,以稳定训练并提升收敛性。
- 利用跳跃连接与特征拼接,在解码路径中保留空间细节并丰富特征图。
- 采用ResNet-50作为主干网络,并采用单尺度推理以确保与最先进方法的公平比较。
实验结果
研究问题
- RQ1在多个层级上联合推理RGB与深度模态是否能提升语义分割的准确性?
- RQ2带有多任务蒸馏的双分支解码器在多大程度上影响训练收敛性与模型性能?
- RQ3与逐元素或门控融合相比,编码器中基于注意力机制的多模态融合在多大程度上提升了特征表征能力?
- RQ4来自相关任务(如法向估计)的辅助监督是否能提升在具有挑战性的类别上的分割鲁棒性?
主要发现
- 所提方法在NYUDv2数据集上达到52.5% mIoU,优于相同评估协议下的先前最先进方法。
- 在SUN-RGBD数据集上,该方法达到62.1% mAcc.,较之前最佳方法提升4.1%,展现出在大规模数据上的强大性能。
- 双分支解码器显著稳定了训练过程,相比无此类监督的模型,损失振荡减少且收敛速度加快。
- 该模型在床、窗帘、梳妆台、淋浴间与木板等困难类别上表现尤为出色,表明其对模糊或复杂场景具有鲁棒性。
- 尽管预训练阶段仅使用深度引导监督,该方法在mAcc.上仍优于PAP与PSD等多任务学习基线模型,表明其特征利用效率高。
- 定性结果表明边界精度得到改善,且在与背景颜色相近的区域中分割错误显著减少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。