[论文解读] Global-Local Propagation Network for RGB-D Semantic Segmentation
本文提出GLPNet,一种用于RGB-D语义分割的新型双流编码器-解码器网络,通过局部上下文融合模块(L-CFM)实现动态空间对齐,以及全局上下文融合模块(G-CFM)实现多模态联合上下文建模,从而增强深度特征传播。该方法在NYU-Depth v2(54.6% mIoU)和SUN-RGBD(51.2% mIoU)上达到最先进性能,使用原始深度输入时,在两个基准测试上均超过之前方法超过2% mIoU。
Depth information matters in RGB-D semantic segmentation task for providing additional geometric information to color images. Most existing methods exploit a multi-stage fusion strategy to propagate depth feature to the RGB branch. However, at the very deep stage, the propagation in a simple element-wise addition manner can not fully utilize the depth information. We propose Global-Local propagation network (GLPNet) to solve this problem. Specifically, a local context fusion module(L-CFM) is introduced to dynamically align both modalities before element-wise fusion, and a global context fusion module(G-CFM) is introduced to propagate the depth information to the RGB branch by jointly modeling the multi-modal global context features. Extensive experiments demonstrate the effectiveness and complementarity of the proposed fusion modules. Embedding two fusion modules into a two-stream encoder-decoder structure, our GLPNet achieves new state-of-the-art performance on two challenging indoor scene segmentation datasets, i.e., NYU-Depth v2 and SUN-RGBD dataset.
研究动机与目标
- 为解决传统多阶段特征融合在RGB-D语义分割中的局限性,即简单逐元素相加无法在深层网络阶段充分利用深度信息。
- 改善双流编码器中因非对称下采样导致的RGB与深度特征之间的空间错位问题。
- 通过全局上下文建模,使深度信息能够影响高层表示,从而增强RGB特征的语义引导能力。
- 设计一种融合机制,联合利用局部精度与全局上下文,实现更有效的跨模态特征传播。
- 在不依赖HHA编码的前提下,实现在标准RGB-D分割基准上的最先进性能,避免增加推理成本。
提出的方法
- GLPNet采用以ResNet-101为骨干网络的双流编码器-解码器架构,早期阶段分别独立处理RGB与深度输入。
- 局部上下文融合模块(L-CFM)通过卷积层预测空间偏移量,随后进行特征扭曲,在逐元素相加前实现RGB与深度特征的动态对齐。
- 全局上下文融合模块(G-CFM)通过计算来自两种模态的基于注意力的池化掩码,对深度特征进行加权聚合,实现对每个RGB像素的上下文建模。
- L-CFM与G-CFM并行应用于编码器最后一级,其输出通过卷积块处理后拼接,再输入解码器。
- 解码器采用类似FPN的结构,通过来自浅层编码器阶段的跳跃连接,并在融合前将特征维度减少至256。
- 网络采用端到端训练,损失函数包括交叉熵损失与Dice损失,最后一阶段使用空洞卷积以保持分辨率。
实验结果
研究问题
- RQ1在深层网络中,RGB与深度特征之间的动态空间对齐是否能改善跨模态融合?
- RQ2联合建模多模态全局上下文是否能增强语义分割中的深度特征传播?
- RQ3局部与全局融合机制的结合是否能优于传统晚期融合中的逐元素相加?
- RQ4使用原始深度图像而非HHA编码是否能带来更好的性能与效率?
- RQ5所提出的融合模块是否能在多样化的室内场景数据集上实现良好泛化?
主要发现
- 在NYU-Depth v2测试集上,GLPNet达到54.6% mIoU,较之前最先进方法(SA-Gate)提升2.2个百分点。
- 在SUN-RGBD数据集上,GLPNet将基线mIoU从44.0%提升至51.2%,创下新最先进记录。
- 消融实验表明,L-CFM与G-CFM均显著贡献,其中L-CFM提升mIoU 0.14%,G-CFM提升1.49%(NYU-Depth v2)。
- 采用K=15池化区域的G-CFM变体表现最佳(mIoU 50.31%),证明全局上下文建模的重要性。
- 与依赖HHA编码的方法相比,使用原始深度输入可获得更优性能并降低推理成本,验证了其优越性。
- G-CFM池化掩码的可视化显示,模型能有效学习关注两种模态中语义相关区域,表明注意力学习有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。