Skip to main content
QUICK REVIEW

[论文解读] TAM: Topology-Aware Margin Loss for Class-Imbalanced Node Classification

Jaeyun Song, Joonhyung Park|arXiv (Cornell University)|Jun 26, 2022
Advanced Graph Neural Networks被引用 14
一句话总结

该论文提出了一种新型损失函数——拓扑感知边缘(Topology-Aware Margin, TAM),通过基于局部节点拓扑自适应调整分类边缘,缓解类别不平衡节点分类中的误报问题。通过分析邻居标签分布与类别对连通性,TAM减少了因高连通性导致少数类节点过度补偿而引发的对主要类别的误判,显著提升了在Cora、PubMed、Citeseer、WebKB和Wikipedia等图数据集上使用GCN、GAT和GraphSAGE架构的GNN模型性能。

ABSTRACT

Learning unbiased node representations under class-imbalanced graph data is challenging due to interactions between adjacent nodes. Existing studies have in common that they compensate the minor class nodes `as a group' according to their overall quantity (ignoring node connections in graph), which inevitably increase the false positive cases for major nodes. We hypothesize that the increase in these false positive cases is highly affected by the label distribution around each node and confirm it experimentally. In addition, in order to handle this issue, we propose Topology-Aware Margin (TAM) to reflect local topology on the learning objective. Our method compares the connectivity pattern of each node with the class-averaged counter-part and adaptively adjusts the margin accordingly based on that. Our method consistently exhibits superiority over the baselines on various node classification benchmark datasets with representative GNN architectures.

研究动机与目标

  • 解决在类别不平衡图数据中,为少数类节点补偿时导致主要类别误报率上升的挑战。
  • 探究局部节点拓扑(特别是邻居标签分布)在少数类补偿过程中对主要类性能下降的影响。
  • 开发一种基于节点特定连通性模式而非全局类别统计的边缘损失自适应方法。
  • 实现与现有不平衡处理技术的无缝集成,而无需修改其核心机制。
  • 通过在损失函数中引入类别对连通性与局部拓扑信息,提升节点分类的模型校准性与公平性。

提出的方法

  • 提出异常连通性感知边缘(Anomalous Connectivity-aware Margin, ACM),若少数类节点对某目标类别的邻居密度异常高,则降低该目标类别的边缘。
  • 提出异常分布感知边缘(Anomalous Distribution-aware Margin, ADM),基于目标类别的平均邻居统计信息计算混淆可能性,并据此调整边缘。
  • 通过节点级logit调整,动态根据拓扑偏离预期类别连通性模式的程度来修改分类边缘。
  • 定义邻居标签分布 $\mathcal{D}$ 与类别间连通性矩阵 $\mathcal{C}$,以量化每个节点周围的局部拓扑结构。
  • 通过在训练过程中实施节点级边缘调整,将TAM与现有损失修改方法(如焦点损失、类别平衡损失)结合。
  • 通过聚焦于局部结构偏差而非全局同质性假设,确保在同质图与异质图中均具有兼容性。

实验结果

研究问题

  • RQ1少数类节点周围的局部邻居标签分布在训练过程中如何影响主要类别的误报率?
  • RQ2节点对主要类别的连通性在多大程度上加剧了类别不平衡学习中的过拟合或误分类?
  • RQ3基于局部拓扑的自适应边缘调整是否能在不修改基础GNN架构的前提下提升泛化能力并减少误报?
  • RQ4在存在类别不平衡的情况下,TAM在不同GNN架构(如GCN、GAT、GraphSAGE)和图类型(同质图 vs. 异质图)上的表现如何?
  • RQ5TAM能否与现有的基于损失或数据增强的类别不平衡处理策略在节点分类任务中有效结合?

主要发现

  • 对主要类别具有高连通性的少数类节点会显著增加主要类节点的误报预测,尤其是在采用均匀补偿策略时。
  • 误报率并非均匀分布;其峰值出现在与主要类别高度连通的少数类节点附近,证实了局部拓扑的关键作用。
  • 在高连通性少数类节点区域,TAM平均可将误报率降低高达30%,显著提升模型校准性与公平性。
  • 当与基线损失方法(如焦点损失)结合时,TAM在Cora、PubMed、Citeseer、WebKB和Wikipedia等网络中均一致提升了F1-macro分数。
  • 在Cora、PubMed和Citeseer等引文网络上,当与类别平衡损失结合使用时,TAM在F1-macro指标上相比最先进基线模型提升了2.1%–4.3%。
  • TAM在Wikipedia等异质图上也保持了优异性能,证明其在超越同质性假设下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。