[论文解读] Class-wise Dynamic Graph Convolution for Semantic Segmentation
本文提出类别自适应动态图卷积(CDGC),一种新颖模块,通过从粗预测构建类别特定图,并动态采样困难正负样本,实现自适应、上下文感知的特征聚合,从而提升语义分割性能。基于该模块构建的CDGCNet在Cityscapes(82.0% mIOU)、PASCAL VOC 2012(83.9% mIOU)和COCO Stuff(40.7% mIOU)上均达到当前最优性能,展现出卓越的边界保持能力和上下文推理能力。
Recent works have made great progress in semantic segmentation by exploiting contextual information in a local or global manner with dilated convolutions, pyramid pooling or self-attention mechanism. In order to avoid potential misleading contextual information aggregation in previous works, we propose a class-wise dynamic graph convolution (CDGC) module to adaptively propagate information. The graph reasoning is performed among pixels in the same class. Based on the proposed CDGC module, we further introduce the Class-wise Dynamic Graph Convolution Network(CDGCNet), which consists of two main parts including the CDGC module and a basic segmentation network, forming a coarse-to-fine paradigm. Specifically, the CDGC module takes the coarse segmentation result as class mask to extract node features for graph construction and performs dynamic graph convolutions on the constructed graph to learn the feature aggregation and weight allocation. Then the refined feature and the original feature are fused to get the final prediction. We conduct extensive experiments on three popular semantic segmentation benchmarks including Cityscapes, PASCAL VOC 2012 and COCO Stuff, and achieve state-of-the-art performance on all three benchmarks.
研究动机与目标
- 解决现有方法在像素级语义分割中聚合长距离上下文信息的局限性。
- 克服因对语义差异较大的区域特征进行无差别聚合而导致的特征学习不具区分性的问题。
- 通过利用类别特定的动态图结构,聚焦于推理过程中的困难样本,提升特征表示能力。
- 构建一种从粗到精的框架,通过基于图的特征精炼机制优化初始预测结果。
- 通过改进的上下文建模与边界保持能力,在主要基准测试上实现最先进性能。
提出的方法
- 利用粗分割预测作为类别掩码,构建类别自适应图,按语义类别提取节点特征。
- 在每个类别特定图上执行动态图卷积,其中边权重基于特征相似性自适应学习。
- 在图构建过程中引入困难正样本与困难负样本,聚焦于具有挑战性的像素。
- 采用双分支特征精炼机制:通过图卷积对原始特征图进行精炼,并将其与原始特征融合以生成最终预测。
- 在从粗到精的范式下,将CDGC模块集成到基础分割网络(如ResNet-101 + ASPP)中。
- 在推理阶段应用多尺度与翻转增强策略,进一步提升性能。
实验结果
研究问题
- RQ1类别特定图构建是否能提升语义分割中的长距离上下文推理能力?
- RQ2与均匀采样或固定采样相比,困难正负样本的动态采样是否能增强特征学习?
- RQ3在特征区分度与边界准确率方面,类别自适应图卷积相较于全局自注意力机制或标准GCN有何差异?
- RQ4结合图精炼的从粗到精框架在标准基准测试上能将mIOU提升至何种程度?
- RQ5在复杂城市与杂乱场景中,困难样本挖掘对性能提升的贡献有多大?
主要发现
- CDGCNet在Cityscapes验证集上达到82.0% mIOU,超越此前最先进方法。
- 在PASCAL VOC 2012上,CDGCNet实现83.9% mIOU,优于所有对比中列出的先前方法。
- 在COCO Stuff数据集上,CDGCNet达到40.7% mIOU,创下该挑战性数据集的新最先进性能。
- 消融实验表明,在Cityscapes上引入困难负样本可使性能从80.5%提升至81.1% mIOU。
- 可视化结果表明,CDGC模块能有效解决困难样本,尤其在物体边界处,有效保留细节。
- 多尺度与翻转增强的结合使Cityscapes上的性能提升0.8%,证实了该方法的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。