[论文解读] Self-supervised Graph Neural Networks without explicit negative sampling
SelfGNN 提出了一种自监督图神经网络,通过利用批量归一化隐式引入对比项,从而消除显式的负采样。它引入了四种高效的特征增强技术,其性能与拓扑增强相当,同时避免了 O(N³) 的计算开销,实现在七个真实世界数据集上与监督 GNN 相当的最先进性能。
Real world data is mostly unlabeled or only few instances are labeled. Manually labeling data is a very expensive and daunting task. This calls for unsupervised learning techniques that are powerful enough to achieve comparable results as semi-supervised/supervised techniques. Contrastive self-supervised learning has emerged as a powerful direction, in some cases outperforming supervised techniques. In this study, we propose, SelfGNN, a novel contrastive self-supervised graph neural network (GNN) without relying on explicit contrastive terms. We leverage Batch Normalization, which introduces implicit contrastive terms, without sacrificing performance. Furthermore, as data augmentation is key in contrastive learning, we introduce four feature augmentation (FA) techniques for graphs. Though graph topological augmentation (TA) is commonly used, our empirical findings show that FA perform as good as TA. Moreover, FA incurs no computational overhead, unlike TA, which often has O(N^3) time complexity, N-number of nodes. Our empirical evaluation on seven publicly available real-world data shows that, SelfGNN is powerful and leads to a performance comparable with SOTA supervised GNNs and always better than SOTA semi-supervised and unsupervised GNNs. The source code is available at https://github.com/zekarias-tilahun/SelfGNN.
研究动机与目标
- 解决对比自监督图学习中显式负采样带来的高计算成本和复杂性问题。
- 探究通过批量归一化引入的隐式对比项是否可替代 GNN 中的显式负采样。
- 开发轻量级、高效的特征增强技术,避免拓扑增强带来的 O(N³) 复杂度。
- 仅通过自监督预训练,实现与监督 GNN 相当的性能。
- 证明自监督 GNN 可在无显式对比项的情况下超越现有的半监督和无监督基线方法。
提出的方法
- SelfGNN 采用类似 Siamese 的双分支 GNN 架构,共享权重,从同一图的两个增强视图中学习表征。
- 其依赖批量归一化隐式生成负样本,从而无需显式负采样。
- 引入四种特征增强(FA)技术:Split(特征置换)、PPR(个性化 PageRank)、HK(热核)和 Katz(Katz 中心性),均按节点应用。
- 该方法与架构无关,兼容任意 GNN 类型,且无需投影头,经消融实验发现其无任何增益。
- 训练采用对比目标,最大化两个增强视图之间的对齐,同时依赖批量归一化实现隐式对比。
- 框架使用标准节点分类基准进行评估,所有数据集采用固定的超参数。
实验结果
研究问题
- RQ1仅靠批量归一化是否能提供足够的对比信号以替代 GNN 中的显式负采样?
- RQ2特征增强技术与拓扑增强在性能和效率上相比如何?
- RQ3移除投影头是否会导致自监督 GNN 性能下降?
- RQ4自监督 GNN 是否可在无任何标注数据的情况下实现与监督 GNN 相当的性能?
- RQ5与拓扑增强相比,所提方法在大规模图上是否具备可扩展性和高效性?
主要发现
- SelfGNN 在七个真实世界数据集(包括 Cora、Citeseer 和 Pubmed)上实现了与最先进监督 GNN 相当的性能。
- 该模型始终优于现有的半监督和无监督 GNN,证明了隐式对比学习的有效性。
- 特征增强技术(FA)的性能与拓扑增强(TA)相当,尽管 FA 计算成本更低且时间复杂度为常数。
- 拓扑增强需要强正则化和更少的训练轮次,而特征增强则受益于更高的 dropout 率和更多的训练轮次。
- 批量归一化至关重要:移除后性能变得不稳定且显著下降。
- 投影头未带来可测量的收益,反而增加方差,因此在 SelfGNN 中被合理地移除。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。