Skip to main content
QUICK REVIEW

[论文解读] A Note on Spectral Clustering and SVD of Graph Data

Ziwei Zhang|arXiv (Cornell University)|Sep 27, 2018
Advanced Graph Neural Networks参考文献 5被引用 4
一句话总结

本文通过证明谱聚类识别图中最具平滑性的信号基,而归一化邻接矩阵 A_rw 的 SVD 同时捕捉平滑与振荡的信号分量,建立了谱聚类与 SVD 在图数据中的精确数学联系。关键洞见在于:仅当 A_rw 的前 k 个特征值全为正时,谱聚类才对应于 A_rw 的前 k 个 SVD 分量,而这一条件在真实图中极少成立,因此必须通过图信号处理重新诠释该关系。

ABSTRACT

Spectral clustering and Singular Value Decomposition (SVD) are both widely used technique for analyzing graph data. In this note, I will present their connections using simple linear algebra, aiming to provide some in-depth understanding for future research.

研究动机与目标

  • 澄清谱聚类与图数据中 SVD 之间的理论关系。
  • 解决一个常见误解:即谱聚类等价于通过 SVD 对归一化邻接矩阵 A_rw 进行最佳低秩逼近。
  • 证明谱聚类与 SVD 的关联取决于 A_rw 特征值的符号分布,而该分布通常并非全为正。
  • 通过图信号处理重新诠释谱聚类,将其与图信号的平滑性联系起来。

提出的方法

  • 推导归一化拉普拉斯矩阵 L_rw = I - D^(-1)A,并将其与图上的随机游走联系起来。
  • 应用 Eckart-Young 定理,证明前 k 个 SVD 在 Frobenius 范数下对任意矩阵提供最佳低秩逼近。
  • 利用定理 1,将前 k 个 SVD 与按特征值绝对值大小排序的前 k 个 EVD(符号差异除外)等价起来。
  • 分析 A_rw = D^(-1)A 的特征值结构,表明 L_rw 的最小特征值对应于 A_rw 的最大正特征值(接近 1),而 L_rw 的最大特征值对应于 A_rw 的最小负特征值(接近 -1)。
  • 将谱聚类重新诠释为通过选择 L_rw 的最小特征值对应的基向量来选取最平滑的信号基。
  • 建立 A_rw 的 SVD 同时捕捉最平滑与最非平滑的信号基的关系,对应于 A_rw 的前 k 个绝对值最大的特征值。

实验结果

研究问题

  • RQ1谱聚类是否对应于通过 SVD 对归一化邻接矩阵 A_rw 的最佳秩-k 逼近?
  • RQ2为何通常假设谱聚类等同于 A_rw 的前 k 个 SVD 分量在一般情况下是错误的?
  • RQ3当 A_rw 的特征值不全为正时,谱聚类与 SVD 的真实关系是什么?
  • RQ4A_rw 与 L_rw 的特征值和特征向量如何与图上的信号平滑性相关?
  • RQ5图信号处理能否提供对谱聚类与 SVD 关联的更准确解释?

主要发现

  • 谱聚类对应于归一化拉普拉斯矩阵 L_rw 的最小特征值所对应的特征向量,这些特征向量代表最具平滑性的图信号。
  • 归一化邻接矩阵 A_rw 的前 k 个 SVD 对应于 A_rw 的前 k 个绝对值最大的特征值,而非其数值大小。
  • 声称 X_sc Λ_sc X_sc^T 是 A_rw 的最佳秩-k 逼近仅在 A_rw 的前 k 个特征值全为正时成立,而这一条件在真实图中极少满足。
  • 对于真实图,A_rw 的特征值中约有一半为正,一半为负,因此朴素的 SVD 等价关系不成立。
  • L_rw 的最小特征值对应于 A_rw 的最大正特征值(接近 1),而 L_rw 的最大特征值对应于 A_rw 的最小负特征值(接近 -1)。
  • 因此,A_rw 的 SVD 同时捕捉平滑与非平滑的信号基,而谱聚类仅捕捉最平滑的成分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。