Skip to main content
QUICK REVIEW

[论文解读] The Power Mean Laplacian for Multilayer Graph Clustering

Pedro Mercado, Antoine Gautier|arXiv (Cornell University)|Mar 1, 2018
Complex Network Analysis Techniques被引用 16
一句话总结

本文提出了幂平均拉普拉斯矩阵(Power Mean Laplacian),这是一种单参数矩阵均值族,通过融合多层图中多个图层的拉普拉斯矩阵,以改进谱聚类。结果表明,当参数趋近于 $-\infty$ 时,该方法在随机块模型中能完美恢复真实聚类,并提出了一种高效的数值算法,在无需显式构造稠密幂平均矩阵的前提下计算特征向量,从而实现对大规模稀疏图的可扩展性。

ABSTRACT

Multilayer graphs encode different kind of interactions between the same set of entities. When one wants to cluster such a multilayer graph, the natural question arises how one should merge the information different layers. We introduce in this paper a one-parameter family of matrix power means for merging the Laplacians from different layers and analyze it in expectation in the stochastic block model. We show that this family allows to recover ground truth clusters under different settings and verify this in real world data. While computing the matrix power mean can be very expensive for large graphs, we introduce a numerical scheme to efficiently compute its eigenvectors for the case of large sparse graphs.

研究动机与目标

  • 解决多层图中融合多层信息以提升聚类性能的挑战。
  • 开发一种基于矩阵均值的系统性融合方法,将算术平均、几何平均和调和平均推广至拉普拉斯矩阵。
  • 在两种设定下分析该方法在随机块模型(SBM)中的理论性能:所有图层均提供信息,以及仅集体信息有效。
  • 设计一种可扩展的数值算法,用于在不显式构造稠密矩阵的前提下计算矩阵幂均值的主导特征向量。

提出的方法

  • 提出一种单参数矩阵幂均值族,用于组合多个图层的归一化拉普拉斯矩阵。
  • 通过泛函分析将标量幂均值公式 $ m_p(x_1,\dots,x_T) = \left(\frac{1}{T}\sum x_i^p\right)^{1/p} $ 扩展至对称半正定矩阵。
  • 将矩阵幂均值应用于每一图层的归一化拉普拉斯矩阵 $ L_{\text{sym}}^{(t)} $,以构建组合拉普拉斯矩阵 $ \mathcal{L}_p $。
  • 采用基于Krylov子空间的幂法高效计算 $ \mathcal{L}_p $ 的主导特征向量,避免显式计算稠密矩阵。
  • 在所得组合拉普拉斯矩阵上应用谱聚类,得到最终聚类结果。
  • 在随机块模型(SBM)下,对完全信息和部分信息图层设定分别进行期望分析。

实验结果

研究问题

  • RQ1多层图中拉普拉斯矩阵的矩阵幂均值是否能优于标准算术平均,在恢复真实聚类方面表现更优?
  • RQ2在多层图聚类中,幂均值参数 $ p $ 的最优取值是什么?
  • RQ3当单个图层信息较弱时,矩阵幂均值是否仍能保持或增强社区结构?
  • RQ4能否在不显式构造稠密矩阵的前提下,高效计算矩阵幂均值的主导特征向量?

主要发现

  • 当幂均值参数 $ p \to -\infty $ 时,该方法在随机块模型下,即使单个图层无信息,也能在期望中完美恢复真实聚类。
  • 该方法显著优于标准拉普拉斯矩阵算术平均,后者被证明在多层图聚类中为次优方法。
  • 理论分析证实,矩阵幂均值保留了聚类所需的谱结构,且在SBM设定下,特征值与特征向量可明确表征。
  • 所提出的数值方案每轮迭代的时间复杂度为 $ O(kn) $,其中 $ k $ 为特征向量数量,$ n $ 为节点数,从而实现对大规模稀疏图的可扩展性。
  • 在合成SBM图上的实证验证表明,该方法在多个稀疏图样本中均表现出稳定的聚类恢复能力,与理论预期一致。
  • 真实世界数据实验表明,该方法在异质性或弱信息图层设置下,聚类性能显著优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。