Skip to main content
QUICK REVIEW

[论文解读] Truncated Affinity Maximization: One-class Homophily Modeling for Graph Anomaly Detection

Qiao Hezhe, Guansong Pang|arXiv (Cornell University)|May 29, 2023
Complex Network Analysis Techniques被引用 4
一句话总结

本文提出了一种新型无监督图异常检测方法——截断亲和最大化(TAM),通过在迭代截断的图上学习定制化的节点表征,利用一类同质性(即正常节点之间具有强局部亲和性)来实现。TAM在具有挑战性的现实世界数据集上相比现有方法,AUROC和AUPRC指标均提升超过10%,达到最先进性能。

ABSTRACT

We reveal a one-class homophily phenomenon, which is one prevalent property we find empirically in real-world graph anomaly detection (GAD) datasets, i.e., normal nodes tend to have strong connection/affinity with each other, while the homophily in abnormal nodes is significantly weaker than normal nodes. However, this anomaly-discriminative property is ignored by existing GAD methods that are typically built using a conventional anomaly detection objective, such as data reconstruction. In this work, we explore this property to introduce a novel unsupervised anomaly scoring measure for GAD, local node affinity, that assigns a larger anomaly score to nodes that are less affiliated with their neighbors, with the affinity defined as similarity on node attributes/representations. We further propose Truncated Affinity Maximization (TAM) that learns tailored node representations for our anomaly measure by maximizing the local affinity of nodes to their neighbors. Optimizing on the original graph structure can be biased by nonhomophily edges (i.e., edges connecting normal and abnormal nodes). Thus, TAM is instead optimized on truncated graphs where non-homophily edges are removed iteratively to mitigate this bias. The learned representations result in significantly stronger local affinity for normal nodes than abnormal nodes. Extensive empirical results on 10 real-world GAD datasets show that TAM substantially outperforms seven competing models, achieving over 10% increase in AUROC/AUPRC compared to the best contenders on challenging datasets. Our code is available at https://github.com/mala-lab/TAM-master/.

研究动机与目标

  • 识别现实世界图异常检测(GAD)数据集中此前被忽视的异常判别性特征:一类同质性,即正常节点之间高度关联,而异常节点内部同质性较弱。
  • 提出一种新的无监督异常评分度量——局部节点亲和性,该度量为与邻居在特征或表征空间中相似度较低的节点分配更高得分。
  • 通过提出图截断策略,在训练过程中移除连接正常与异常节点的非同质性边(即非同质性边),以缓解标准GNN中此类边带来的表征质量偏差。
  • 通过在截断图上使用新颖的目标函数端到端优化节点表征,以最大化局部节点亲和性,从而实现正常与异常节点之间的更好分离。
  • 在大规模及伪装属性设置下,展示所提方法的鲁棒性与可扩展性。

提出的方法

  • 基于节点与其邻居在表征空间中的余弦相似度,提出局部节点亲和性作为异常评分,亲和性越低表示异常可能性越高。
  • 提出截断亲和最大化(TAM),一种通过最大化每个节点与其邻居在表征空间中平均相似度来优化表征的训练目标。
  • 应用迭代图截断,移除连接正常与异常节点的边(即非同质性边),以防止表征同质化并减少优化偏差。
  • 使用GNN编码器学习节点表征,通过在截断图上端到端优化TAM目标,增强正常节点的亲和性,同时抑制异常节点的亲和性。
  • 采用多尺度聚合策略,整合不同截断深度下的异常评分,以提升鲁棒性与性能。
  • 采用自监督对比目标(DGI)作为基线进行比较,但通过基于一类同质性的表征学习优势,证明TAM的优越性。

实验结果

研究问题

  • RQ1在现实世界图异常检测数据集中,是否存在一类同质性——即正常节点之间高度关联,而异常节点之间关联性弱?
  • RQ2局部节点亲和性(即节点在表征空间中与邻居的相似度)能否作为有效的无监督异常评分度量?
  • RQ3通过迭代图截断移除非同质性边,能否提升用于异常检测的节点表征质量?
  • RQ4在截断图上优化局部亲和性,是否相比标准重建或自监督目标,能实现正常与异常节点之间更好的分离?
  • RQ5所提方法在属性伪装场景下(即恶意节点模仿正常节点特征)是否具有鲁棒性?

主要发现

  • 在10个现实世界GAD数据集上,TAM相比最佳基线方法,AUROC平均提升10.5%,AUPRC平均提升12.5%。
  • 在OGB-Proteins数据集上,TAM取得AUROC 0.7449和AUPRC 0.2173,优于第二好的方法(SL-GAD)1.8% AUROC和4.2% AUPRC。
  • 在大规模图(如Amazon-all、YelpChi-all)上,TAM分别保持AUROC 0.8476和0.5818的优异性能,显著优于所有基线方法。
  • 在30%属性伪装条件下,TAM在BlogCatalog上保持AUROC 0.7831,在Facebook上保持AUROC 0.8650,表明对特征级对抗性操纵具有强鲁棒性。
  • 消融实验确认图截断至关重要:移除该机制后,AUROC平均下降15%,表明非同质性边严重损害性能。
  • 多尺度评分聚合可使AUROC最高提升8%,表明结合不同截断深度的结果能显著增强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。