Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Subspace Clustering via k-Factorization

Jicong Fan|arXiv (Cornell University)|Dec 8, 2020
Face and Expression Recognition参考文献 39被引用 5
一句话总结

本文提出k-因子分解子空间聚类(k-FSC),一种线性复杂度方法,通过结构化稀疏性直接将数据分解为k个子空间,跳过邻接矩阵构建与谱聚类步骤。该方法在大规模、噪声数据及流式数据上实现了最先进精度与效率,并通过扩展支持在线与样本外聚类。

ABSTRACT

Subspace clustering (SC) aims to cluster data lying in a union of low-dimensional subspaces. Usually, SC learns an affinity matrix and then performs spectral clustering. Both steps suffer from high time and space complexity, which leads to difficulty in clustering large datasets. This paper presents a method called k-Factorization Subspace Clustering (k-FSC) for large-scale subspace clustering. K-FSC directly factorizes the data into k groups via pursuing structured sparsity in the matrix factorization model. Thus, k-FSC avoids learning affinity matrix and performing eigenvalue decomposition, and has low (linear) time and space complexity on large datasets. This paper proves the effectiveness of the k-FSC model theoretically. An efficient algorithm with convergence guarantee is proposed to solve the optimization of k-FSC. In addition, k-FSC is able to handle sparse noise, outliers, and missing data, which are pervasive in real applications. This paper also provides online extension and out-of-sample extension for k-FSC to handle streaming data and cluster arbitrarily large datasets. Extensive experiments on large-scale real datasets show that k-FSC and its extensions outperform state-of-the-art methods of subspace clustering.

研究动机与目标

  • 解决依赖邻接矩阵计算与谱聚类的传统子空间聚类方法存在的高时间与空间复杂度问题。
  • 通过消除存储与计算大型邻接矩阵的需求,实现大规模数据集的有效聚类。
  • 开发一种可处理稀疏噪声、异常值、缺失数据及流式数据的方法,这些在真实应用中普遍存在。
  • 为非凸、非光滑的k-FSC模型提供理论保证与高效优化方法。
  • 将k-FSC扩展至在线与样本外设置,以处理任意大规模或动态变化的数据集。

提出的方法

  • 提出一种组稀疏矩阵分解模型,将数据直接分解为对应k个聚类的k个子空间,避免邻接矩阵构建。
  • 在分解过程中施加结构化稀疏性,以强制实现组内聚类,优化目标为低秩、组稀疏解。
  • 采用具有收敛性保证的高效交替方向乘子法(ADMM)算法,求解非凸、非光滑优化问题。
  • 引入k-FSC-MB(小批量)与k-FSC-L(在线)变体,通过分批或顺序处理数据,实现对海量数据的可扩展性。
  • 通过引入L1-范数正则化,将k-FSC扩展至鲁棒聚类,以处理稀疏噪声、异常值与缺失数据。
  • 通过学习新数据点到聚类分配的映射,实现样本外扩展,利用学习到的分解结果。

实验结果

研究问题

  • RQ1具有结构化稀疏性的直接矩阵分解方法是否能在保持线性时间与空间复杂度的同时,实现最先进子空间聚类精度?
  • RQ2在传统谱聚类方法因计算复杂度而失效的大规模数据集上,k-FSC的性能如何?
  • RQ3k-FSC是否能在无需预处理的情况下,有效应对真实世界数据中的稀疏噪声、异常值与缺失数据?
  • RQ4k-FSC的在线与样本外扩展在流式数据与任意大规模数据场景下的表现如何?
  • RQ5k-FSC模型在恢复真实子空间结构方面的有效性有何理论依据?

主要发现

  • 在Epileptic与Postures数据集上,k-FSC在准确率(ACC)与标准化互信息(NMI)上均达到最高,优于S5C与S3COMP-C,尽管后者计算成本较高。
  • 在Covtype与PokerHand数据集上,k-FSC在Covtype上取得43.95% ACC与5.59% NMI,在PokerHand上取得21.82% ACC,显著优于所有基线方法,包括SSSC与LSC-K。
  • k-FSC-MB与k-FSC-L在Postures数据集上的训练时间分别缩短至9.1秒与5.9秒,而k-FSC为173.9秒,S3COMP-C为755.3秒,同时保持了具有竞争力的准确率。
  • k-FSC的在线与样本外扩展使处理大到无法装入内存的数据集成为可能,展示了超越传统方法的可扩展性。
  • k-FSC对稀疏噪声与缺失数据表现出鲁棒性,在不同污染程度的真实世界数据集上性能保持稳定。
  • 所提出的算法在实践中收敛可靠,且为优化过程建立了理论收敛性保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。