Skip to main content
QUICK REVIEW

[论文解读] SCG-Net: Self-Constructing Graph Neural Networks for Semantic Segmentation

Qinghui Liu, Michael Kampffmeyer|arXiv (Cornell University)|Sep 3, 2020
Advanced Neural Network Applications参考文献 53被引用 12
一句话总结

本文提出 SCG-Net,一种自构建图神经网络,通过可微分图结构构建模块,直接从特征图中学习长距离像素依赖关系,实现在语义分割中的高效全局上下文建模。该方法在 ISPRS Potsdam 和 Vaihingen 数据集上分别取得 92.0% 和 89.8% 的平均 F1 分数,性能达到当前最优水平,且参数量更少、计算成本更低,优于同类基于 CNN 的模型。

ABSTRACT

Capturing global contextual representations by exploiting long-range pixel-pixel dependencies has shown to improve semantic segmentation performance. However, how to do this efficiently is an open question as current approaches of utilising attention schemes or very deep models to increase the models field of view, result in complex models with large memory consumption. Inspired by recent work on graph neural networks, we propose the Self-Constructing Graph (SCG) module that learns a long-range dependency graph directly from the image and uses it to propagate contextual information efficiently to improve semantic segmentation. The module is optimised via a novel adaptive diagonal enhancement method and a variational lower bound that consists of a customized graph reconstruction term and a Kullback-Leibler divergence regularization term. When incorporated into a neural network (SCG-Net), semantic segmentation is performed in an end-to-end manner and competitive performance (mean F1-scores of 92.0% and 89.8% respectively) on the publicly available ISPRS Potsdam and Vaihingen datasets is achieved, with much fewer parameters, and at a lower computational cost compared to related pure convolutional neural network (CNN) based models.

研究动机与目标

  • 为解决在遥感语义分割中高效建模长距离像素依赖关系的挑战。
  • 消除图神经网络模型中对人工设计或静态先验知识图的依赖。
  • 开发一种轻量化、端到端可训练的框架,利用图神经网络处理密集预测任务。
  • 提升在高分辨率航拍图像中复杂、小尺寸及上下文依赖性强的物体(如汽车和建筑物)上的分割性能。
  • 相比深度 CNN 和注意力机制模型,降低计算和参数成本。

提出的方法

  • 提出一种自构建图(SCG)模块,通过类似变分自编码器的框架,从 CNN 特征图中直接学习潜在图结构。
  • 采用可微分图结构构建机制,通过带定制化图重构项和 Kullback-Leibler 散度正则化的变分下界,优化节点嵌入与边概率。
  • 引入自适应对角增强方法以稳定训练并提升图结构学习能力。
  • 应用两层图神经网络(如 GCN 或 GIN)在所学图上传播上下文信息,实现节点级分类。
  • 将最终的节点预测结果映射回二维图像空间,生成密集语义分割掩码。
  • 使用标准反向传播算法对整个模型进行端到端训练。

实验结果

研究问题

  • RQ1可学习的、端到端可微分图结构构建机制是否能在无先验知识图的前提下,有效建模语义分割中的长距离依赖?
  • RQ2SCG-Net 在准确率、参数效率和计算成本方面,与强基线 CNN 模型及注意力机制模型相比表现如何?
  • RQ3自构建图在多大程度上提升了训练稳定性和收敛速度?
  • RQ4不同图神经网络架构(如 GCN 与 GIN)对性能的影响如何,特别是在小尺寸和密集物体上的表现?
  • RQ5所学习的图结构对模型性能的贡献有多大?其学习到的依赖关系是否具备可解释性?

主要发现

  • SCG-Net 在 ISPRS Potsdam 数据集上取得 92.0% 的平均 F1 分数,在 Vaihingen 数据集上取得 89.8% 的平均 F1 分数,性能优于或匹配强基线模型,且参数量显著更少。
  • 与深度 CNN 及 DANet、非局部网络等注意力机制模型相比,该模型显著降低了计算成本和参数数量。
  • 在推理过程中移除所学习的图结构会使 mF1 下降 2.4%,训练步数增加 5 倍,证明图结构在性能和训练效率中起关键作用。
  • 在 SCG-Net 框架中结合 GCN 与 GIN 可使小物体(如汽车)的 F1 分数提升最高达 0.8%,表明谱系与空间图神经网络具有互补优势。
  • 模型在分割紧密相邻的小尺寸物体时仍存在局限,常将多个物体合并为单一分割区域,表明当前图神经网络在空间定位方面仍面临挑战。
  • 消融实验表明 SCG 模块对性能至关重要,无该模块的变体在准确率和训练效率方面均出现显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。