[论文解读] Multi-Stage Self-Supervised Learning for Graph Convolutional Networks on Graphs with Few Labels
该论文提出了一种名为多阶段自监督(M3S)训练的新算法,通过结合多阶段训练框架与基于DeepCluster的自监督学习,显著提升了在标注节点极少的图上图卷积网络(GCNs)的性能。通过迭代地优化伪标签并对齐嵌入表示,M3S在所有标签率下均显著提升了泛化能力,尤其在低监督水平下表现优于当前最先进方法。
Graph Convolutional Networks(GCNs) play a crucial role in graph learning tasks, however, learning graph embedding with few supervised signals is still a difficult problem. In this paper, we propose a novel training algorithm for Graph Convolutional Network, called Multi-Stage Self-Supervised(M3S) Training Algorithm, combined with self-supervised learning approach, focusing on improving the generalization performance of GCNs on graphs with few labeled nodes. Firstly, a Multi-Stage Training Framework is provided as the basis of M3S training method. Then we leverage DeepCluster technique, a popular form of self-supervised learning, and design corresponding aligning mechanism on the embedding space to refine the Multi-Stage Training Framework, resulting in M3S Training Algorithm. Finally, extensive experimental results verify the superior performance of our algorithm on graphs with few labeled nodes under different label rates compared with other state-of-the-art approaches.
研究动机与目标
- 为解决在标注节点稀少时GCN因浅层结构限制标签信号传播而导致泛化能力差的问题。
- 在弱监督设置下,为GCN开发一种在极少量标注数据条件下始终有效的训练算法。
- 将自监督学习(特别是DeepCluster)整合到多阶段训练框架中,利用未标注数据提升模型性能。
- 设计一种基于聚类的一致性对齐机制,以提升伪标签质量并稳定低标签率图上的训练过程。
提出的方法
- 提出一种多阶段训练框架,通过迭代地将高置信度的未标注节点(赋予伪标签)加入训练集,模拟带有置信度过滤的自训练过程。
- 应用DeepCluster对GCN生成的嵌入特征进行聚类,无需人工标注即可为未标注节点生成伪标签。
- 设计一种新颖的对齐机制,强制聚类分配与预测类别分布之间的一致性,从而提升伪标签质量。
- 以级联方式将DeepCluster生成的伪标签与多阶段框架集成,实现各阶段中嵌入表示与预测结果的逐步优化。
- 采用对称拉普拉斯平滑作为理论基础,分析GCN的局限性,并论证采用更深、迭代式训练的必要性。
- 使用最大-最小比值(Max-Min Ratio)度量伪标签中的类别平衡性,优化DeepCluster中聚类数量,避免出现平凡解。
实验结果
研究问题
- RQ1由于标签信号传播效率低下,GCN在低标签率下的性能是否会显著下降?
- RQ2结合迭代伪标签化的多阶段训练框架能否提升在标注节点稀少的图上GCN的泛化能力?
- RQ3当与多阶段训练策略结合时,通过DeepCluster实现的自监督学习如何增强模型性能?
- RQ4在低监督设置下,聚类数量对伪标签平衡性及最终分类准确率有何影响?
- RQ5所提出的M3S框架是否能在多种图数据集和标签率下始终超越现有最先进方法?
主要发现
- 在低标签率图上,GCN性能显著下降,当标签数量极小时甚至低于标签传播方法的性能。
- 现有方法如Co-Training、Self-Training、Union和Intersection在不同标签率下表现不一致,限制了实际部署。
- 多阶段训练框架优于标准自训练方法,尤其在稀疏标签设置下,凸显了迭代数据扩展的价值。
- M3S训练算法在所有数据集和标签率下均持续超越所有最先进基线方法,且在最低标签率下取得最大性能提升。
- 最大-最小比值度量表明,增加DeepCluster中的聚类数量可改善类别平衡性,从而提升模型性能。
- 该方法在Cora、Citeseer和PubMed数据集上达到最先进准确率,尤其在低标签率下,PubMed数据集的性能提升高达70.6%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。