Skip to main content
QUICK REVIEW

[论文解读] Self-Enhanced GNN: Improving Graph Neural Networks Using Model Outputs

Han Yang, Yan Xiao|arXiv (Cornell University)|Feb 18, 2020
Advanced Graph Neural Networks参考文献 41被引用 8
一句话总结

本文提出 Self-Enhanced GNN (SEG),一种通用框架,通过利用预训练 GNN 模型的输出来优化输入数据,从而提升图神经网络性能。该框架引入了拓扑结构更新以减少类间边,并采用训练节点增强技术,利用伪标签扩展已标注的训练集,进而在 GCN、GAT 和 SGC 的基准数据集上实现平均 16.2% 的错误率降低。

ABSTRACT

Graph neural networks (GNNs) have received much attention recently because of their excellent performance on graph-based tasks. However, existing research on GNNs focuses on designing more effective models without considering much about the quality of the input data. In this paper, we propose self-enhanced GNN (SEG), which improves the quality of the input data using the outputs of existing GNN models for better performance on semi-supervised node classification. As graph data consist of both topology and node labels, we improve input data quality from both perspectives. For topology, we observe that higher classification accuracy can be achieved when the ratio of inter-class edges (connecting nodes from different classes) is low and propose topology update to remove inter-class edges and add intra-class edges. For node labels, we propose training node augmentation, which enlarges the training set using the labels predicted by existing GNN models. SEG is a general framework that can be easily combined with existing GNN models. Experimental results validate that SEG consistently improves the performance of well-known GNN models such as GCN, GAT and SGC across different datasets.

研究动机与目标

  • 通过提升输入数据质量来改善图神经网络性能,尽管数据质量在模型成功中起着关键作用,但常被忽视。
  • 解决噪声图结构(尤其是类间边)和标注数据有限导致半监督节点分类性能受限的问题。
  • 开发一种可泛化的框架,利用现有 GNN 模型的输出,迭代提升数据质量以获得更好的下游性能。
  • 通过使用模型预测结果更新图结构和训练集标签,实现 GNN 的协同训练与自训练。
  • 通过设计适用于多种 GNN 架构和真实世界数据集的技术,确保框架的鲁棒性与可扩展性。

提出的方法

  • 提出拓扑结构更新(TU),基于预训练 GNN 模型预测的节点标签,移除类间边并添加类内边,从而降低图中的噪声比例。
  • 实施训练节点增强(TNA),通过添加多个多样化 GNN 模型预测的高置信度伪标签节点,扩展训练集。
  • 利用多个 GNN 模型的集成预测结果,提高伪标签节点的标签可靠性并降低错误率。
  • 应用置信度阈值(τc)控制所添加节点的质量,仅将高置信度预测结果纳入训练集。
  • 在 TNA 中引入类别平衡机制,防止在增强后的训练集中模型对主导类别产生偏差。
  • 设计 SEG 框架为模块化结构,兼容任意现有 GNN 模型,实现即插即用的性能提升。

实验结果

研究问题

  • RQ1能否利用预训练 GNN 模型的输出来提升输入数据质量,从而改善节点分类性能?
  • RQ2通过拓扑结构更新降低类间边比例,是否能提升半监督节点分类的准确率?
  • RQ3利用多个多样化 GNN 模型生成的伪标签进行训练节点增强,能在多大程度上提升模型泛化能力并降低错误率?
  • RQ4用于伪标签生成的 GNN 模型之间的多样性如何影响增强后训练集的可靠性?
  • RQ5所提出的自增强框架是否可普遍应用于不同 GNN 架构而无需修改网络结构?

主要发现

  • SEG 在七个基准数据集上持续提升了 GCN、GAT 和 SGC 的性能,平均错误率降低 16.2%。
  • 在 CORA 数据集上,拓扑结构更新成功通过移除 82.6% 的类间边并添加 76.4% 的类内边,显著降低了噪声比例。
  • 训练节点增强在 GCN 上以 10.05% 的错误率添加了 826 个节点,而 SGC 在添加 637 个节点时实现了最低错误率 7.06%。
  • 使用两个多样化 GNN 模型进行伪标签生成在准确率增益与错误控制之间达到最佳平衡,超过两个模型后收益递减。
  • TNA 中的类别平衡机制显著提升了模型性能,在 Amazon Photo 数据集上将准确率从 86.6% 提升至 89.5%,有效防止了增强数据集中类别的不平衡。
  • 最大错误率降低达到 35.1%(在 CiteSeer 数据集上),表明该框架在较小且更具挑战性的数据集上具有显著影响力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。