[论文解读] Graph Laplacian Regularized Graph Convolutional Networks for Semi-supervised Learning
该论文提出图拉普拉斯正则化图卷积网络(gLGCN),通过在特征表示和标签预测中整合图拉普拉斯正则化,提升图结构数据上的半监督学习性能。通过强制实施局部不变性——确保相似节点具有相似的表示和标签——该模型增强了鲁棒性,并在引文网络基准测试中达到最先进性能,准确率提升最高达:Citeseer 上 71.4%,Cora 上 83.3%,PubMed 上 79.3%。
Recently, graph convolutional network (GCN) has been widely used for semi-supervised classification and deep feature representation on graph-structured data. However, existing GCN generally fails to consider the local invariance constraint in learning and representation process. That is, if two data points Xi and Xj are close in the intrinsic geometry of the data distribution, then their labels/representations should also be close to each other. This is known as local invariance assumption which plays an essential role in the development of various kinds of traditional algorithms, such as dimensionality reduction and semi-supervised learning, in machine learning area. To overcome this limitation, we introduce a graph Laplacian GCN (gLGCN) approach for graph data representation and semi-supervised classification. The proposed gLGCN model is capable of encoding both graph structure and node features together while maintains the local invariance constraint naturally for robust data representation and semi-supervised classification. Experiments show the benefit of the benefits the proposed gLGCN network.
研究动机与目标
- 解决标准 GCN 无法强制实施局部不变性的问题,即相似节点应具有相似的表示和标签。
- 将图拉普拉斯正则化整合到特征学习与标签预测中,以保留数据的局部几何结构。
- 通过利用流形假设与标签传播,提升半监督节点分类中的鲁棒性与泛化能力。
- 在单一框架下统一特征表示与标签预测的优化过程,并引入联合正则化。
- 在标准引文网络数据集(Cora、Citeseer、PubMed)上,相比现有半监督方法,展示出更优的性能。
提出的方法
- 提出一种统一损失函数,结合 GCN 交叉熵损失与最终层表示 $X^{(K)}$ 和标签预测 $Z$ 的图拉普拉斯正则化项。
- 使用图拉普拉斯正则化项 $\mathcal{L}_{\mathrm{reg}}(X^{(K)}) = \sum_{i,j} S_{ij} \|X^{(K)}_i - X^{(K)}_j\|^2$ 以保留学习到的特征中的局部结构。
- 应用标签预测正则化 $\mathcal{L}_{\mathrm{reg}}(Z) = \sum_{i,j} S_{ij} \|Z_i - Z_j\|^2$,以强制预测结果在图上保持平滑性。
- 通过邻接矩阵 $A$ 或使用高斯核的 k-近邻图构建相似性矩阵 $S$,其中 $S_{ij}$ 表示节点 $i$ 与 $j$ 之间的相似度。
- 使用反向传播端到端训练模型,联合优化 GCN 架构与正则化项。
- 引入一种考虑标签相关性的正则化变体 $C_{ij}$,通过区分同类别与异类别节点对,进一步提升性能。
实验结果
研究问题
- RQ1图拉普拉斯正则化是否能提升 GCN 在半监督节点分类中的鲁棒性与准确性?
- RQ2在特征表示与标签预测中同时强制实施局部不变性,是否能提升图结构数据上的泛化能力?
- RQ3所提出的 gLGCN 模型与当前最先进方法(如 GCN、Planetoid 和 ManiReg)相比,在标准引文网络基准测试中的表现如何?
- RQ4在特征学习与标签预测中分别应用正则化,对整体性能的贡献分别是什么?
- RQ5通过显式建模类别相似性,标签相关性感知正则化是否能进一步提升性能?
主要发现
- 所提出的 gLGCN-F-L 模型在 Citeseer 上达到 71.4% 的准确率,优于 GCN(70.4%)及其他所有基线模型。
- 在 Cora 上,gLGCN-F-L 达到 83.3% 的准确率,超过 GCN(81.4%)及次优基线(Planetoid 为 75.7%)。
- 在 PubMed 上,gLGCN-F-L 达到 79.3% 的准确率,超过 GCN(78.6%)并优于 Planetoid(77.2%)。
- 消融实验表明,同时在特征表示与标签预测中应用正则化可获得最佳性能。
- gLGCN-L(仅标签正则化)在 Citeseer 上达到 71.3%,在 Cora 上达到 82.7%,表明仅标签平滑化即可带来显著性能提升。
- 该模型在所有三个基准数据集上均表现出一致的性能提升,验证了引入局部不变性约束的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。