[论文解读] Towards Scalable Spectral Clustering via Spectrum-Preserving Sparsification
本文提出了一种两阶段谱稀疏化框架,构建了超稀疏、树状的子图,保留了原始近邻(NN)图的关键特征值和特征向量,从而实现了高度可扩展且准确的谱聚类。通过结合近乎线性时间的谱图拓扑稀疏化与基于随机梯度下降(SGD)的边权缩放,该方法在Covtype数据集上实现了高达9,703倍的加速(9.43秒 vs. 91,504秒),同时保持或提升了聚类准确率。
The eigendeomposition of nearest-neighbor (NN) graph Laplacian matrices is the main computational bottleneck in spectral clustering. In this work, we introduce a highly-scalable, spectrum-preserving graph sparsification algorithm that enables to build ultra-sparse NN (u-NN) graphs with guaranteed preservation of the original graph spectrums, such as the first few eigenvectors of the original graph Laplacian. Our approach can immediately lead to scalable spectral clustering of large data networks without sacrificing solution quality. The proposed method starts from constructing low-stretch spanning trees (LSSTs) from the original graphs, which is followed by iteratively recovering small portions of "spectrally critical" off-tree edges to the LSSTs by leveraging a spectral off-tree embedding scheme. To determine the suitable amount of off-tree edges to be recovered to the LSSTs, an eigenvalue stability checking scheme is proposed, which enables to robustly preserve the first few Laplacian eigenvectors within the sparsified graph. Additionally, an incremental graph densification scheme is proposed for identifying extra edges that have been missing in the original NN graphs but can still play important roles in spectral clustering tasks. Our experimental results for a variety of well-known data sets show that the proposed method can dramatically reduce the complexity of NN graphs, leading to significant speedups in spectral clustering.
研究动机与目标
- 为解决在大规模近邻图上进行昂贵的特征值分解所导致的谱聚类计算瓶颈问题。
- 开发一种可扩展的方法,确保在超稀疏子图中保留原始图拉普拉斯矩阵的关键谱特性(特征值与特征向量)。
- 通过构建原始NN图的近似线性大小代理图,实现在大规模数据集上快速、准确的谱聚类。
- 克服现有近似方法缺乏谱保留保证且常导致聚类准确率下降的局限性。
提出的方法
- 应用近乎线性时间的谱图拓扑稀疏化方法,识别并保留谱上关键的边,形成树状子图。
- 采用一种新颖的基于随机梯度下降(SGD)的迭代边权缩放阶段,优化稀疏化子图中的边权。
- 构建两阶段框架:首先进行拓扑稀疏化,以在保留谱结构的同时减小图的规模;其次进行边权缩放,以优化谱相似性。
- 利用谱图稀疏化的理论进展,确保所得到的子图保持原始拉普拉斯矩阵的前几个最小非平凡特征值与特征向量。
- 以生成树作为基础结构,并添加受控数量的非树边(由预算b控制),以提升谱保真度。
- 通过SGD实现子图缩放,迭代调整边权,最小化原始图与稀疏化图之间谱之间的差异。
实验结果
研究问题
- RQ1近乎线性时间的谱稀疏化方法是否能在大幅减小图规模的同时,保留原始图拉普拉斯矩阵的关键特征值与特征向量?
- RQ2所提出的两阶段框架——先进行拓扑稀疏化,再进行边权缩放——是否相比现有近似方法能带来更优的聚类准确率?
- RQ3在不损失准确率的前提下,超稀疏、树状的子图在谱聚类中在多大程度上可作为大规模NN图的有效代理?
- RQ4添加的非树边数量(预算b)如何影响稀疏化图中最低特征值的稳定性和准确性?
主要发现
- 在包含581,012个样本的Covtype数据集上,所提方法相比原始谱聚类实现了9,703倍的加速(9.43秒 vs. 91,504秒),且聚类准确率无损失。
- 在MNIST数据集上,该方法实现了3,571倍的加速,同时保持或略微提升了相比原始方法的聚类准确率。
- 使用谱稀疏化图进行聚类的准确率在大多数数据集中超过了原始图,表明稀疏化过程去除了噪声或虚假的边。
- 仅添加0.01|V|条非树边即可在Covtype数据集中达到峰值聚类准确率,证明了该稀疏化方法的高效率。
- 边权缩放阶段显著提升了性能:未进行缩放的子图即使添加了更多非树边,也未能达到使用缩放边权所实现的准确率水平。
- 随着非树边的增加,最低特征值的变异系数降低,证实了谱稳定性的提升,并验证了该方法的理论基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。