[论文解读] Self-Constructing Graph Convolutional Networks for Semantic Labeling
该论文提出了一种新型架构——自构建图卷积网络(SCG-Net),该架构能够直接从输入特征中端到端地学习自构建最优的非局部上下文图,而无需先验知识。通过使用可学习的潜在变量和带有自适应对角增强的变分下界,SCG-Net在ISPRS Vaihingen数据集上实现了89.8%的F1分数,参数量比当前最先进模型减少14%,FLOPs也更低。
Graph Neural Networks (GNNs) have received increasing attention in many fields. However, due to the lack of prior graphs, their use for semantic labeling has been limited. Here, we propose a novel architecture called the Self-Constructing Graph (SCG), which makes use of learnable latent variables to generate embeddings and to self-construct the underlying graphs directly from the input features without relying on manually built prior knowledge graphs. SCG can automatically obtain optimized non-local context graphs from complex-shaped objects in aerial imagery. We optimize SCG via an adaptive diagonal enhancement method and a variational lower bound that consists of a customized graph reconstruction term and a Kullback-Leibler divergence regularization term. We demonstrate the effectiveness and flexibility of the proposed SCG on the publicly available ISPRS Vaihingen dataset and our model SCG-Net achieves competitive results in terms of F1-score with much fewer parameters and at a lower computational cost compared to related pure-CNN based work. Our code will be made public soon.
研究动机与目标
- 为解决现有图神经网络(GNNs)在语义标注中因依赖人工构建的先验图而存在的局限性。
- 开发一种方法,能够从输入特征中自动学习最优图结构,而无需先验知识。
- 将自构建图整合到深度学习流水线中,以改善航拍图像中长距离依赖关系的建模。
- 在降低模型复杂度和计算成本的前提下,实现具有竞争力的语义标注性能。
提出的方法
- SCG模块采用类似变分自编码器的框架,从2D特征图中学习潜在嵌入表示,使用重参数化的高斯变量。
- 通过可微的图构建过程,从潜在表示生成加权邻接矩阵 $\hat{A}$,支持端到端训练。
- 提出一种自适应对角增强方法,通过向邻接矩阵添加 $\gamma \cdot \text{diag}(A')$ 来改善邻域保持能力。
- 模型采用变分下界损失,结合图重构损失与Kullback-Leibler散度正则化。
- 引入残差预测头 $\hat{\mathbf{y}} = \gamma \cdot \hat{\mathbf{z}}$ 以优化最终预测结果。
- SCG-Net将SCG模块与CNN主干网络(ResNet50)及两层GCN结合,用于最终的语义分割。
实验结果
研究问题
- RQ1能否在不依赖先验知识图的前提下,从原始特征图中自构建图以实现语义标注?
- RQ2可微的、端到端可训练的图构建机制在航拍图像中如何提升长距离上下文建模能力?
- RQ3自适应对角增强与变分正则化对图质量与分割性能有何影响?
- RQ4自构建图架构能否在参数量更少、FLOPs更低的前提下,实现与现有CNN和GCN模型相当的性能?
主要发现
- SCG-Net在ISPRS Vaihingen测试集上实现了89.8%的F1分数,与性能最佳的模型DDCM-R50持平。
- 该模型仅使用874万个参数,比DDCM-R50的999万个参数减少了12.5%。
- SCG-Net的计算成本为4.37 Giga FLOPs,低于DDCM-R50的4.86 Giga FLOPs。
- 自适应对角增强方法有效提升了邻域保持能力,有助于学习更优的图结构。
- 定性结果表明,SCG-Net的预测结果在视觉上与真实标签高度接近,尤其在复杂物体区域表现更优。
- 该模型在多种地表覆盖类型(包括建筑物、树木和低矮植被)上均展现出强大的泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。