Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Contrastive Attributed Graph Clustering

Wei Xia, Quanxue Gao|arXiv (Cornell University)|Oct 15, 2021
Advanced Graph Neural Networks参考文献 36被引用 11
一句话总结

该论文提出SCAGC,一种自监督对比属性图聚类方法,通过使用不精确聚类标签的对比损失,联合优化节点表示学习与聚类。通过在端到端框架中整合聚类模块与自监督图对比学习模块,SCAGC在四个基准数据集上实现了最先进性能,相较于之前方法在NMI指标上最高提升7.7%,并实现了对新样本节点标签的直接预测。

ABSTRACT

Attributed graph clustering, which learns node representation from node attribute and topological graph for clustering, is a fundamental but challenging task for graph analysis. Recently, methods based on graph contrastive learning (GCL) have obtained impressive clustering performance on this task. Yet, we observe that existing GCL-based methods 1) fail to benefit from imprecise clustering labels; 2) require a post-processing operation to get clustering labels; 3) cannot solve out-of-sample (OOS) problem. To address these issues, we propose a novel attributed graph clustering network, namely Self-supervised Contrastive Attributed Graph Clustering (SCAGC). In SCAGC, by leveraging inaccurate clustering labels, a self-supervised contrastive loss, which aims to maximize the similarities of intra-cluster nodes while minimizing the similarities of inter-cluster nodes, are designed for node representation learning. Meanwhile, a clustering module is built to directly output clustering labels by contrasting the representation of different clusters. Thus, for the OOS nodes, SCAGC can directly calculate their clustering labels. Extensive experimental results on four benchmark datasets have shown that SCAGC consistently outperforms 11 competitive clustering methods.

研究动机与目标

  • 为解决现有图对比学习方法在属性图聚类中的局限性,包括对不精确标签利用不足、依赖后处理以及无法处理新样本节点的问题。
  • 开发一种端到端框架,通过聚类模块生成的伪标签,联合优化节点表示学习与聚类分配。
  • 通过学习统一的表示与聚类函数,实现对新样本节点聚类标签的直接预测。
  • 通过在节点表示上应用对比学习,以及在聚类分配上应用对比聚类损失,提升聚类性能。
  • 证明伪标签监督可增强图表示学习,从而获得更具判别性与紧凑性的聚类结构。

提出的方法

  • SCAGC采用图增强技术生成属性图的多个视图,实现在节点表示与聚类分配上的对比学习。
  • 聚类模块生成软聚类分配概率,用于计算对比聚类损失,以最大化簇内一致性并最小化簇间一致性。
  • 图表示学习模块基于伪标签(聚类分配)使用自监督对比损失,使同一簇的节点表示对齐,而不同簇的节点表示分离。
  • 聚类与表示学习两个模块通过端到端方式相互交互并联合训练,实现表示与聚类分配的相互优化。
  • 通过直接应用学习到的聚类函数于新节点,无需微调即可实现新样本推理。
  • 自监督对比损失基于温度缩放的对比目标,利用伪标签簇,即使在标签噪声存在的情况下也能提升表示质量。

实验结果

研究问题

  • RQ1使用不精确聚类标签的自监督对比学习能否提升属性图聚类中节点表示的质量?
  • RQ2将聚类模块与图表示学习模块联合训练,是否能比独立训练获得更优的聚类性能?
  • RQ3所提出的框架能否直接预测新样本节点的聚类标签,从而克服以往基于GCL方法的关键局限?
  • RQ4对比聚类模块在优化聚类分配与提升表示紧凑性方面的有效性如何?
  • RQ5在缺乏真实标签的情况下,伪标签监督在多大程度上能增强图对比学习?

主要发现

  • SCAGC在四个基准数据集上持续优于11种最先进基线方法,在DBLP数据集上NMI指标相比最接近的竞争对手GCA最高提升7.7%。
  • 消融实验表明,对比聚类模块显著提升性能,SCAGC w/o CCM在ACM与DBLP数据集上的聚类指标出现显著下降。
  • 所提出的自监督GCRL损失(使用伪标签)相比标准对比损失能带来更优的表示学习,如SCAGC w/o SSC性能低于完整模型所示。
  • t-SNE可视化显示,随着训练迭代进行,节点表示变得更加紧凑且分离清晰,表明聚类结构学习效果提升。
  • 收敛性分析表明,SCAGC收敛迅速,前100次迭代中目标值急剧下降,ACM数据集上聚类指标在200次迭代后趋于稳定。
  • 该框架通过直接应用学习到的聚类函数成功处理新样本节点,无需重新训练或后处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。