Skip to main content
QUICK REVIEW

[论文解读] Non-linear Attributed Graph Clustering by Symmetric NMF with PU Learning

Seiji Maekawa, Koh Takeuchi|arXiv (Cornell University)|Sep 21, 2018
Face and Expression Recognition参考文献 26被引用 8
一句话总结

本文提出NAGC,一种基于对称非负矩阵分解(NMF)与正样本-未标记样本(PU)学习的非线性属性图聚类方法,以捕捉图拓扑结构与顶点属性之间的复杂关系。通过学习拓扑与属性聚类分配之间的非线性映射,并利用PU学习处理部分观测到的正边,该方法在聚类质量与效率方面表现优越,计算复杂度为$O((n^2 + mn)kt)$,在真实世界数据集上优于现有方法。

ABSTRACT

We consider the clustering problem of attributed graphs. Our challenge is how we can design an effective and efficient clustering method that precisely captures the hidden relationship between the topology and the attributes in real-world graphs. We propose Non-linear Attributed Graph Clustering by Symmetric Non-negative Matrix Factorization with Positive Unlabeled Learning. The features of our method are three holds. 1) it learns a non-linear projection function between the different cluster assignments of the topology and the attributes of graphs so as to capture the complicated relationship between the topology and the attributes in real-world graphs, 2) it leverages the positive unlabeled learning to take the effect of partially observed positive edges into the cluster assignment, and 3) it achieves efficient computational complexity, $O((n^2+mn)kt)$, where $n$ is the vertex size, $m$ is the attribute size, $k$ is the number of clusters, and $t$ is the number of iterations for learning the cluster assignment. We conducted experiments extensively for various clustering methods with various real datasets to validate that our method outperforms the former clustering methods regarding the clustering quality.

研究动机与目标

  • 解决属性图聚类中拓扑结构与属性呈现不同且复杂聚类结构的挑战。
  • 通过建模拓扑聚类分配与基于属性的聚类分配之间的非线性关系,提升聚类质量。
  • 通过引入PU学习处理真实图中的开放世界假设,即仅部分正边被观测到,从而提升对缺失正边的鲁棒性。
  • 设计一种可扩展至大量属性的高效算法,避免属性维度带来的二次方计算开销。
  • 在无需完全监督或标记负边的情况下实现高性能。

提出的方法

  • 该方法采用对称非负矩阵分解(SNMF)联合学习图拓扑与顶点属性的聚类分配。
  • 在拓扑聚类分配与属性聚类分配的潜在空间之间学习非线性映射函数,以建模复杂且非线性的关系。
  • 集成正样本-未标记样本(PU)学习以建模开放世界假设,即未观测到的边不被假设为负边,从而提升对缺失正边的鲁棒性。
  • 目标函数结合SNMF用于拓扑与属性聚类,以及一个PU学习组件,该组件对将未观测边错误分类为负边的情况施加惩罚。
  • 算法采用交替优化并使用闭式更新,以保持计算效率,实现$O((n^2 + mn)kt)$的复杂度。
  • 该方法避免了在属性学习中昂贵的$O(m^2)$操作,从而实现对高维属性的可扩展性。

实验结果

研究问题

  • RQ1在属性图聚类中,拓扑与属性聚类分配之间的非线性映射能否提升聚类准确率?
  • RQ2PU学习在开放世界假设下,对部分观测到的正边的处理效果如何,尤其是在属性图聚类中?
  • RQ3所提出的方法是否能在捕捉复杂拓扑-属性关系的同时保持高效率,特别是在高维属性场景下?
  • RQ4与现有属性图聚类方法(如JWNMF和BAGC)相比,该方法在性能与可扩展性方面表现如何?
  • RQ5该方法对超参数选择是否具有鲁棒性,特别是在属性与边稀疏性各异的真实世界数据集中?

主要发现

  • 所提出的NAGC方法在所有评估数据集(包括WebKB、Citeseer、Cora和polblog)上均优于现有方法(如JWNMF和BAGC),聚类质量更优。
  • 在WebKB上,NAGC的运行时间为2.62秒,在Citeseer上为54.32秒,显著优于JWNMF在高属性数据集上的8.80秒与60.71秒。
  • 消融实验表明,若移除PU学习(Prop. w/o PU),WebKB上的运行时间降至0.81秒,证实PU学习因额外的拓扑更新而增加了计算开销。
  • 即使在属性数量较多时,该方法仍能保持高聚类质量,展现出对高维数据的可扩展性与鲁棒性。
  • 该方法在不同超参数设置下表现稳定,对基线方法持续保持性能优势,表明对参数调优的敏感度较低。
  • PU学习的集成通过将未观测边建模为未知而非负边,实现了更准确的聚类分配,从而在边信息不完整的现实图中提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。