Skip to main content
QUICK REVIEW

[论文解读] Graph Neural Network with Curriculum Learning for Imbalanced Node Classification

Xiaohe Li, Lijie Wen|arXiv (Cornell University)|Feb 5, 2022
Advanced Graph Neural Networks被引用 6
一句话总结

该论文提出 GNN-CL,一种结合课程学习的图神经网络框架,通过结合基于平滑性和同质性的自适应图过采样与基于邻居的度量学习,解决节点分类中的类别不平衡问题。该方法在训练过程中动态平衡过采样与度量学习损失,跨多个基准数据集实现最先进性能,在高度不平衡设置下相对提升最高达 20%。

ABSTRACT

Graph Neural Network (GNN) is an emerging technique for graph-based learning tasks such as node classification. In this work, we reveal the vulnerability of GNN to the imbalance of node labels. Traditional solutions for imbalanced classification (e.g. resampling) are ineffective in node classification without considering the graph structure. Worse still, they may even bring overfitting or underfitting results due to lack of sufficient prior knowledge. To solve these problems, we propose a novel graph neural network framework with curriculum learning (GNN-CL) consisting of two modules. For one thing, we hope to acquire certain reliable interpolation nodes and edges through the novel graph-based oversampling based on smoothness and homophily. For another, we combine graph classification loss and metric learning loss which adjust the distance between different nodes associated with minority class in feature space. Inspired by curriculum learning, we dynamically adjust the weights of different modules during training process to achieve better ability of generalization and discrimination. The proposed framework is evaluated via several widely used graph datasets, showing that our proposed model consistently outperforms the existing state-of-the-art methods.

研究动机与目标

  • 解决 GNN 在类别不平衡节点分类任务中的脆弱性,即少数类节点因连通性不足和传播受限而表示不充分的问题。
  • 克服传统重采样与代价敏感学习在图设置中的局限性,后者常忽略结构先验且存在过拟合风险。
  • 构建统一框架,通过整合基于图的过采样与度量学习,同时提升表示质量与泛化能力。
  • 通过课程学习动态平衡过采样与度量学习的贡献,提升模型鲁棒性与判别能力。
  • 在具有不同类别不平衡程度的多样化图数据集上验证所提方法的有效性。

提出的方法

  • 提出自适应图过采样方法,基于中间层嵌入中的特征平滑性与同质性生成合成节点与边。
  • 引入基于邻居的三元组损失,通过在特征空间中分离少数类节点,学习判别性特征表示。
  • 将图分类损失与度量学习损失结合,联合优化节点分类与类间分离。
  • 采用课程学习动态调整训练过程中过采样与度量学习模块的损失权重。
  • 采用两阶段训练策略:首先通过过采样生成可靠的合成节点,然后通过度量学习优化表示。
  • 将该框架应用于多种 GNN 主干网络(如 GCN、GraphSAGE),验证其在不同架构上的泛化能力。

实验结果

研究问题

  • RQ1如何利用图结构在类别不平衡的节点分类中生成可靠的少数类合成节点?
  • RQ2度量学习在多大程度上能提升 GNN 中少数类与多数类节点之间的判别能力?
  • RQ3课程学习能否有效平衡过采样与度量学习的贡献,以避免过拟合并提升泛化性能?
  • RQ4所提方法在不同类别不平衡水平下与现有最先进方法相比表现如何?
  • RQ5该框架是否在不同 GNN 架构与真实世界图数据集上均具备泛化能力?

主要发现

  • 在 Cora 数据集(不平衡比 0.1)上,GNN-CL 达到最高微 F1 分数 0.759,相比次优方法 GraphSMOTE 相对提升超过 20%。
  • 在 BlogCategory 数据集上,GNN-CL 在不平衡比 0.1 时取得微 F1 0.757,显著优于 GCN 与 MLP,后者表现出准确率与类别比例的强相关性。
  • 消融实验表明,过采样与度量学习模块均独立贡献于性能提升,其中仅使用过采样(GNN-CL O)或仅使用度量学习(GNN-CL M)的模型表现具有竞争力但劣于完整模型。
  • 当不平衡比为 0.9(接近平衡)时,GNN-CL 与基线模型的性能差距缩小,表明过采样在高度不平衡场景下效果最显著。
  • 该模型在不同基础 GNN(GCN、GraphSAGE)上均保持一致优势,在所有测试数据集上相较最佳基线提升 2–4%。
  • 超参数分析表明,最优性能在适中规模的过采样与度量学习中伪标签阈值平衡时达到,可避免因过多合成数据或噪声标签导致的过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。