[论文解读] NAFS: A Simple yet Tough-to-beat Baseline for Graph Representation Learning
NAFS 是一种无需训练的非参数化图表示学习方法,通过节点自适应特征平滑和多跳邻域特征集成来增强节点嵌入。它在节点聚类和链接预测任务上优于当前最先进(SOTA)的图神经网络(GNN),同时实现高达 88.6 倍的训练加速,有效缓解了深层 GNN 中的过平滑与可扩展性问题。
Recently, graph neural networks (GNNs) have shown prominent performance in graph representation learning by leveraging knowledge from both graph structure and node features. However, most of them have two major limitations. First, GNNs can learn higher-order structural information by stacking more layers but can not deal with large depth due to the over-smoothing issue. Second, it is not easy to apply these methods on large graphs due to the expensive computation cost and high memory usage. In this paper, we present node-adaptive feature smoothing (NAFS), a simple non-parametric method that constructs node representations without parameter learning. NAFS first extracts the features of each node with its neighbors of different hops by feature smoothing, and then adaptively combines the smoothed features. Besides, the constructed node representation can further be enhanced by the ensemble of smoothed features extracted via different smoothing strategies. We conduct experiments on four benchmark datasets on two different application scenarios: node clustering and link prediction. Remarkably, NAFS with feature ensemble outperforms the state-of-the-art GNNs on these tasks and mitigates the aforementioned two limitations of most learning-based GNN counterparts.
研究动机与目标
- 解决深层 GNN 在图表示学习中面临的过平滑与可扩展性限制问题。
- 探究简单、非参数化的特征平滑方法是否能够超越复杂、可训练的 GNN 架构。
- 开发一种可扩展、高效的基线方法,在无需训练的前提下整合结构与特征信息。
- 提供一种超越端到端 GNN 的、更具可解释性的有效图表示学习新视角。
提出的方法
- NAFS 通过使用归一化邻接矩阵的幂次,逐步聚合多跳邻居的节点特征来实现特征平滑。
- 它采用节点自适应加权策略,根据每个节点的局部结构特性动态调整不同跳数平滑特征的组合方式。
- 该方法通过平均、最大值或拼接等方式进行特征集成,融合多种平滑策略以增强表示的多样性。
- 它完全避免参数学习,因此无需训练,特别适用于大规模图的高效处理。
- 最终的节点嵌入通过自适应组合多跳平滑特征生成,从而降低过平滑风险。
- 它利用归一化邻接矩阵 $\hat{\mathbf{A}} = \mathbf{D}^{-1/2}\mathbf{A}\mathbf{D}^{-1/2}$ 实现稳定且可扩展的平滑操作。
实验结果
研究问题
- RQ1非参数化、无需训练的特征平滑方法是否能在图表示学习中超越最先进的可训练 GNN?
- RQ2与均匀加权或单跳策略相比,NAFS 中对多跳平滑特征的节点自适应加权策略如何提升性能?
- RQ3在不同平滑算子之间进行特征集成,能在多大程度上提升表示质量?
- RQ4NAFS 是否能有效缓解深层图表示中的过平滑问题?
- RQ5在内存与计算资源有限的大规模图上,NAFS 相较于 GNN 的可扩展性如何?
主要发现
- 在 PubMed 数据集上,NAFS 在节点聚类任务中的 NMI 指标分别比 GAE 和 AGE 提高 9.0% 和 3.8%。
- 在 PubMed 数据集上,NAFS 相较于 GAE 和 AGE 分别实现了最高达 65.4× 和 88.6× 的训练加速。
- 在 ogbn-products 数据集上,NAFS 可扩展至 100,000 个节点,推理时间仅需 23.7 秒,而 GAE 和 AGE 因 OOM 错误无法在超过 30,000 个节点的规模上训练。
- NAFS 中的自适应加权策略可防止在高平滑步数下发生过平滑,而朴素平均或单跳方法则无法避免此问题。
- T-SNE 可视化结果表明,即使在 200 次平滑步数下,NAFS 仍能保持类别可分性,而基线方法 $\hat{\mathbf{A}}^k\mathbf{X}$ 的表示已完全混乱。
- 特征集成(平均、最大值、拼接)在所有数据集上均一致提升性能,且无单一策略在所有场景下全面占优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。