Skip to main content
QUICK REVIEW

[论文解读] Unified Robust Training for Graph NeuralNetworks against Label Noise

Yayong Li, Jie Yin|arXiv (Cornell University)|Mar 5, 2021
Machine Learning and Data Classification参考文献 21被引用 6
一句话总结

本文提出UnionNET,一种统一框架,用于在半监督设置下鲁棒地训练图神经网络(GNNs)以应对标签噪声。通过利用随机游走进行标签聚合以估计节点级类别分布,UnionNET 同时执行样本重加权和标签校正,而无需干净监督或显式估计噪声转移矩阵,在多种噪声类型和比例下于多个数据集上实现了最先进性能。

ABSTRACT

Graph neural networks (GNNs) have achieved state-of-the-art performance for node classification on graphs. The vast majority of existing works assume that genuine node labels are always provided for training. However, there has been very little research effort on how to improve the robustness of GNNs in the presence of label noise. Learning with label noise has been primarily studied in the context of image classification, but these techniques cannot be directly applied to graph-structured data, due to two major challenges -- label sparsity and label dependency -- faced by learning on graphs. In this paper, we propose a new framework, UnionNET, for learning with noisy labels on graphs under a semi-supervised setting. Our approach provides a unified solution for robustly training GNNs and performing label correction simultaneously. The key idea is to perform label aggregation to estimate node-level class probability distributions, which are used to guide sample reweighting and label correction. Compared with existing works, UnionNET has two appealing advantages. First, it requires no extra clean supervision, or explicit estimation of the noise transition matrix. Second, a unified learning framework is proposed to robustly train GNNs in an end-to-end manner. Experimental results show that our proposed approach: (1) is effective in improving model robustness against different types and levels of label noise; (2) yields significant improvements over state-of-the-art baselines.

研究动机与目标

  • 为解决在标签噪声下 GNN 训练方法缺乏鲁棒性的问题,特别是在标签稀疏的半监督设置中。
  • 克服基于图像的标签噪声校正方法在图结构上失效的问题,因为图结构存在标签稀疏性和标签依赖性。
  • 开发一种统一框架,同时执行样本重加权与标签校正,而无需依赖干净数据或噪声转移矩阵估计。
  • 提升 GNN 在真实世界图数据集上对对称与非对称标签噪声的泛化能力与鲁棒性。

提出的方法

  • 利用随机游走聚合结构上邻近节点的标签,生成节点级类别概率分布。
  • 利用估计的类别分布指导损失函数中的样本重加权,以降低不可靠标签的影响。
  • 通过在聚合分布表明原始标签不可靠时,用预测概率替换原始标签,实现标签校正。
  • 构建一个统一目标,以端到端方式联合优化模型参数、样本重加权与标签校正。
  • 引入先验分布损失以正则化标签校正,防止在高噪声环境下性能下降。
  • 通过敏感性分析调整超参数 α(重加权与校正之间的权衡)和 β(标签聚合的平滑度)。

实验结果

研究问题

  • RQ1统一框架是否能在无需干净监督的情况下,同时提升 GNN 对标签噪声的鲁棒性并实现有效的标签校正?
  • RQ2通过随机游走进行标签聚合如何提升在稀疏、噪声图设置下的可靠性估计?
  • RQ3在高噪声图场景中,样本重加权与标签校正之间的最优平衡是什么?
  • RQ4超参数 α 与 β 如何影响统一训练框架的性能?
  • RQ5标签校正是否总是提升性能,还是在某些条件下会导致性能下降?

主要发现

  • 在 Cora、Citeseer 和 Pubmed 数据集上,UnionNET 在对称与非对称标签噪声下均实现了最先进性能,优于现有基线方法。
  • 在 Cora 数据集上,40% 对称噪声下,UnionNET-GCN 的准确率达到 0.491,而标准 GCN 仅为 0.420。
  • 消融研究显示,仅含重加权的 UnionNET-R 始终优于 GCN,而含校正的 UnionNET-RC 在高噪声设置下性能较差,除非通过先验分布损失进行正则化。
  • 超参数分析表明,最优性能出现在中等 α 与 β 值,且性能在中等随机游走长度时达到峰值。
  • 在 Pubmed 上,UnionNET 在 α = 1.0 时表现最佳,表明由于强聚类性和更少类别,预测标签更可靠。
  • 该框架在多种 GNN 架构与噪声类型下均表现出鲁棒性,展示了在真实世界图学习中的泛化能力与实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。