Skip to main content
QUICK REVIEW

[论文解读] Provable Estimation of the Number of Blocks in Block Models

Bowei Yan, Purnamrita Sarkar|arXiv (Cornell University)|May 24, 2017
Complex Network Analysis Techniques参考文献 15被引用 5
一句话总结

该论文提出SPUR,一种基于半定规划(SDP)的方法,在弱类内连通性条件下,可证明地估计随机块模型(SBMs)中的块数 $ r $,且无需事先知晓模型参数。该方法在一次优化步骤中同时恢复聚类矩阵与 $ r $,以高概率实现精确恢复,并在模拟网络和真实网络中优于现有最先进方法。

ABSTRACT

Community detection is a fundamental unsupervised learning problem for unlabeled networks which has a broad range of applications. Many community detection algorithms assume that the number of clusters $r$ is known apriori. In this paper, we propose an approach based on semi-definite relaxations, which does not require prior knowledge of model parameters like many existing convex relaxation methods and recovers the number of clusters and the clustering matrix exactly under a broad parameter regime, with probability tending to one. On a variety of simulated and real data experiments, we show that the proposed method often outperforms state-of-the-art techniques for estimating the number of clusters.

研究动机与目标

  • 解决在社区检测中,当 $ r $ 未知时估计随机块模型(SBMs)中聚类数 $ r $ 的挑战,这是该领域常见的局限。
  • 开发一种可同时估计 $ r $ 并恢复聚类矩阵且具有可证明保证的方法,避免对模型参数的先验知识。
  • 将现有基于 SDP 的方法扩展至更弱的假设下——具体而言,从强类内连通性扩展至弱类内连通性,从而扩大适用的参数范围。
  • 通过单一调参探索网络中的子结构,实现多分辨率聚类,支持探索性网络分析。
  • 在模拟网络和真实网络中,优于现有最先进方法,在估计 $ r $ 和恢复聚类成员关系方面表现更优。

提出的方法

  • 该方法使用聚类矩阵的归一化 SDP 松弛形式,受 [39] 中公式的启发,以建模 SBMs 中的块结构。
  • 在目标函数中引入调参 $ \lambda $,以引导对分层子结构的探索,从而实现多级聚类的检测。
  • 算法对 $ \lambda $ 进行网格搜索,选择使基于聚类矩阵特征值间隙的评分准则最大化的值。
  • 当 $ r $ 已知时,该方法完全无需调参;当 $ r $ 未知时,通过一次 SDP 优化联合估计 $ r $ 与聚类矩阵。
  • 该方法在弱类内连通性 SBMs 下具有强一致性,即每个节点在自身簇内的连接概率高于与其他任意簇的连接概率。
  • 它利用 SDP 解的结构来识别聚类边界与子结构,在广泛的参数范围内具有理论保证。

实验结果

研究问题

  • RQ1基于半定规划的方法能否在不依赖模型参数先验知识的情况下,估计随机块模型中的块数 $ r $?
  • RQ2所提出的方法是否在弱类内连通性条件下实现 $ r $ 与聚类矩阵的精确恢复?
  • RQ3该方法能否通过单一优化框架检测网络中的分层或多层次聚类结构?
  • RQ4与现有最先进技术相比,该方法在估计 $ r $ 和恢复聚类成员关系方面的性能如何?
  • RQ5调参对在真实与模拟网络中发现子结构的影响是什么?

主要发现

  • 在弱类内连通性 SBMs 下,SPUR 以高概率实现对聚类数 $ r $ 与聚类矩阵的精确恢复,其适用范围广于以往方法。
  • 在平衡与非平衡聚类大小设置下,SPUR 在 NMI(标准化互信息)与 $ r $ 估计的准确性方面均优于 Bethe-Hessian 估计器(BHac)、USVT 与 CMM。
  • 在空手道俱乐部数据集中,SPUR 正确识别出 $ r=2 $,并在 $ \lambda=1.4 $ 时揭示出更精细的 4 聚类子结构,展示了其多分辨率能力。
  • 在大学美式足球网络中,SPUR 估计 $ r=13 $,接近真实值 $ r=12 $,而 BH、USVT 与 CMM 均估计为 $ r=10 $,表明其性能更优。
  • 在政治博客数据集中,SPUR 估计 $ r=3 $,与真实值一致,而 BH 与 USVT 高估了 $ r $,CMM 则低估了 $ r $。
  • 在合成实验中,随着 $ r $ 从 4 增加到 20,该方法性能下降更缓慢,在保持准确度方面优于竞争方法,尤其在聚类复杂度增加时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。