[论文解读] Beyond Real-world Benchmark Datasets: An Empirical Study of Node Classification with GNNs
本论文通过一个可控的合成图生成器(GenCAT)对图神经网络(GNNs)在节点分类任务中的表现进行了全面的实证研究,该生成器可精确调控图的关键特性——类别不平衡、同质性/异质性、属性偏差以及图规模。研究发现,GNNs在类别不平衡和异质性图上表现不佳,简单模型如SGC在类别不平衡设置下反而优于复杂的GNN模型,且许多GNN在异质性图中未能有效利用图拓扑结构。
Graph Neural Networks (GNNs) have achieved great success on a node classification task. Despite the broad interest in developing and evaluating GNNs, they have been assessed with limited benchmark datasets. As a result, the existing evaluation of GNNs lacks fine-grained analysis from various characteristics of graphs. Motivated by this, we conduct extensive experiments with a synthetic graph generator that can generate graphs having controlled characteristics for fine-grained analysis. Our empirical studies clarify the strengths and weaknesses of GNNs from four major characteristics of real-world graphs with class labels of nodes, i.e., 1) class size distributions (balanced vs. imbalanced), 2) edge connection proportions between classes (homophilic vs. heterophilic), 3) attribute values (biased vs. random), and 4) graph sizes (small vs. large). In addition, to foster future research on GNNs, we publicly release our codebase that allows users to evaluate various GNNs with various graphs. We hope this work offers interesting insights for future research.
研究动机与目标
- 为解决现有GNN评估中缺乏细粒度分析的问题,这些评估通常依赖于特性固定的有限真实世界数据集。
- 探究四类关键图特性——类别大小分布、边同质性、属性偏差和图规模——对GNN性能的影响。
- 提供一个系统化、受控的GNN评估框架,能够隔离并独立变化单一或少数图属性,同时保持其他属性恒定。
- 发布一个开源代码库,支持在多样化合成图配置下对GNN进行可复现且可扩展的基准测试。
提出的方法
- 使用GenCAT这一先进的合成图生成器,创建对类别大小分布、同质性/异质性、属性偏差和图规模具有精确控制的图。
- 采用标准化的评估协议:固定的训练/验证/测试划分、统一的超参数设置,并对所有GNN模型在所有图类型上进行一致的训练。
- 在所有生成的图配置上评估多种GNN模型(包括SGC、GCN、GAT、GraphSAGE和GIN),以隔离图结构导致的性能差异。
- 系统性地一次或两次改变一个或两个图特性,同时保持其他特性不变,从而实现对GNN行为的因果分析。
- 采用标准的节点分类指标(如准确率、宏F1)来量化不同设置下的性能表现。
- 发布一个基于PyTorch的开源库,使未来研究者能够复现并扩展该基准测试框架。
实验结果
研究问题
- RQ1类别大小分布的不平衡在多类别节点分类任务中如何影响GNN的性能?
- RQ2与同质性图相比,GNN在低类内边连通性(即异质性图)上的表现如何?
- RQ3节点属性值(有偏 vs. 随机)在多大程度上影响GNN的性能?
- RQ4图规模(小图 vs. 大图)如何影响GNN的泛化能力和可扩展性?
- RQ5在类别不平衡和异质性等挑战性设置下,最先进GNN模型与简单模型如SGC相比表现如何?
主要发现
- 包括最先进GNN模型在内的GNN在类别不平衡问题上表现显著下降,少数类别性能急剧下滑,主要由于损失函数的偏差。
- 在类别不平衡设置下,简单模型SGC的表现优于更复杂的GNN,因为深层模型由于其归纳偏置而更容易对多数类别过拟合。
- 在异质性图中(同一类节点之间连接稀疏),GNN的性能仅比无图信息的MLP略有提升,表明其对图拓扑结构的利用效率极低。
- 在高异质性设置下,GNN相较于MLP的性能提升有限,表明其通常忽略或未能有效利用此类图中的结构信息。
- 属性偏差对GNN性能有显著影响,具有信息量的属性能显著提升准确率,尤其在低同质性设置下。
- 图规模的影响可测量但不剧烈;GNN在大规模图上表现尚可,但在极端情况下(尤其是高异质性和不平衡时)仍观察到性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。