Skip to main content
QUICK REVIEW

[论文解读] When Do We Need Graph Neural Networks for Node Classification?

Sitao Luan, Chenqing Hua|arXiv (Cornell University)|Oct 30, 2022
Advanced Graph Neural Networks被引用 9
一句话总结

本文提出归一化总变差(NTV)与归一化平滑度值(NSV),用于预测图神经网络(GNNs)在节点分类任务中何时优于与图无关的多层感知机(MLPs)。通过图信号处理与统计假设检验分析特征和标签中的边偏差,该方法识别出GNN获得性能优势的阈值条件,解释了为何在真实图中MLPs有时会优于GNNs。

ABSTRACT

Graph Neural Networks (GNNs) extend basic Neural Networks (NNs) by additionally making use of graph structure based on the relational inductive bias (edge bias), rather than treating the nodes as collections of independent and identically distributed (i.i.d.) samples. Though GNNs are believed to outperform basic NNs in real-world tasks, it is found that in some cases, GNNs have little performance gain or even underperform graph-agnostic NNs. To identify these cases, based on graph signal processing and statistical hypothesis testing, we propose two measures which analyze the cases in which the edge bias in features and labels does not provide advantages. Based on the measures, a threshold value can be given to predict the potential performance advantages of graph-aware models over graph-agnostic models.

研究动机与目标

  • 识别尽管使用图结构,GNN仍无法超越与图无关的MLP的条件。
  • 解决现有同质性度量无法考虑未连接节点对、且无法可靠预测GNN性能的局限性。
  • 提出一种系统性方法,判断图结构中的边偏差何时能为GNN带来相对于非图感知模型的性能优势。
  • 基于图与标签特征,提供一种基于阈值的预测系统,用于在GNN与MLP之间进行选择。

提出的方法

  • 提出归一化总变差(NTV),通过测量连接节点对之间特征变化相对于所有可能节点对的相对变化,量化边偏差对节点特征的影响。
  • 引入归一化平滑度值(NSV),通过假设检验评估边偏差在标签一致性中的统计显著性,判断连接节点是否显著更可能共享标签,而非连接对则不然。
  • 应用谱图理论与图信号处理,建模边偏差如何影响GNN的学习动态,特别是通过低通滤波效应。
  • 在GNN训练中使用基于迹的优化,形式化邻接矩阵对标签传播的影响,表明若连接节点的标签不同,边偏差可能具有破坏性。
  • 整合基于NSV的假设检验所得p值,判断边偏差是否具有统计上的有益性,从而建立基于阈值的模型选择决策规则。
  • 在14个真实世界数据集上验证该方法,将GNN与MLP的性能进行比较,关联NTV与NSV与实际模型性能增益。

实验结果

研究问题

  • RQ1在何种条件下,图结构中的边偏差无法提升GNN性能,使其无法超越与图无关的MLP?
  • RQ2为何在真实世界数据集中,某些GNN在存在图结构的情况下仍表现不如MLP?
  • RQ3我们能否量化标签与特征中边偏差的统计显著性,以预测GNN何时会优于MLP?
  • RQ4现有同质性度量为何无法可靠预测GNN与MLP的性能差异?所提出方法相比有何改进?
  • RQ5NTV与NSV的何种阈值可指示GNN相对于MLP具有可靠的性能优势?

主要发现

  • 在多个数据集(如Cornell、Wisconsin、Texas、Film)上,MLP的性能优于GNN,准确率差距最高达17.48%,表明GNN存在显著的失败案例。
  • 在高同质性数据集(如PubMed、Coauthor CS、Coauthor Phy)上,MLP与GNN性能几乎相同(差异<1%),挑战了GNN始终受益于图结构的假设。
  • 所提出的NSV度量结合假设检验的p值,成功识别出边偏差具有统计显著益处的情况,解释了GNN的性能增益或损失。
  • NTV与NSV在14个真实世界数据集上与实证结果一致,显示边偏差显著性较低时MLP更优。
  • 当连接节点标签不同时,GNN会受到负向边偏差效应的影响,导致错误的标签传播与性能下降。
  • 基于NSV与p值推导出的阈值可可靠预测GNN是否优于MLP,为节点分类任务中的模型选择提供了实用标准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。