Skip to main content
QUICK REVIEW

[论文解读] Stochastic Sparse Subspace Clustering

Ying Chen, Chun-Guang Li|arXiv (Cornell University)|May 4, 2020
Face and Expression Recognition参考文献 64被引用 4
一句话总结

本文提出了一种可扩展且灵活的方法——随机稀疏子空间聚类(S3COMP),通过在自表达模型中引入丢弃(dropout)机制,诱导更密集的表示,从而提升子空间连通性并减少稀疏子空间聚类中的过分割问题。通过将优化问题重新表述为小规模子问题上的共识问题,S3COMP在大规模数据集上实现了最先进的性能,显著提升了聚类准确率和连通性。

ABSTRACT

State-of-the-art subspace clustering methods are based on self-expressive model, which represents each data point as a linear combination of other data points. By enforcing such representation to be sparse, sparse subspace clustering is guaranteed to produce a subspace-preserving data affinity where two points are connected only if they are from the same subspace. On the other hand, however, data points from the same subspace may not be well-connected, leading to the issue of over-segmentation. We introduce dropout to address the issue of over-segmentation, which is based on randomly dropping out data points in self-expressive model. In particular, we show that dropout is equivalent to adding a squared $\ell_2$ norm regularization on the representation coefficients, therefore induces denser solutions. Then, we reformulate the optimization problem as a consensus problem over a set of small-scale subproblems. This leads to a scalable and flexible sparse subspace clustering approach, termed Stochastic Sparse Subspace Clustering, which can effectively handle large scale datasets. Extensive experiments on synthetic data and real world datasets validate the efficiency and effectiveness of our proposal.

研究动机与目标

  • 为解决稀疏子空间聚类(SSC)中的过分割问题,即由于表示过于稀疏,同一子空间中的点可能无法良好连接。
  • 通过引入丢弃作为正则化机制,提升子空间连通性,从而诱导更密集的系数解。
  • 开发一种可扩展且内存高效的算法,通过随机优化求解小规模子问题,以处理超大规模数据集。
  • 提供一种灵活的框架,在保持子空间保持特性的前提下,提升真实世界与合成数据上的聚类性能。

提出的方法

  • 在系数估计过程中,通过随机移除数据矩阵 X 的列来应用丢弃,这在隐式上为表示系数添加了 ℓ₂ 正则化。
  • 该方法将稀疏子空间聚类问题重新表述为通过随机采样生成的多个小规模子问题上的共识优化。
  • 最终表示通过多个随机试验所得解的加权平均计算得出,非零条目根据其频率和大小进行聚合。
  • 该方法利用了丢弃与 ℓ₂ 正则化之间的等价性,相比纯 ℓ₁ 基于稀疏性的方法,能生成更密集且更鲁棒的系数向量。
  • 该算法通过迭代方式实现,收敛性通过外层迭代中支持集大小和聚类准确率的稳定性来监控。
  • 参数调优基于特征值间隔分析和数据集大小进行,对于更大的数据集采用更高的丢弃率 δ。

实验结果

研究问题

  • RQ1是否能有效利用丢弃机制在不牺牲稀疏性或可扩展性的前提下,提升稀疏子空间聚类中的子空间连通性?
  • RQ2基于小规模子问题的随机优化框架是否能在减少过分割的同时保持子空间保持特性?
  • RQ3在真实世界数据集上,所提出方法与 SSCOMP 及其他最先进方法相比,在聚类准确率和连通性方面表现如何?
  • RQ4超参数 δ(丢弃率)和 λ(正则化强度)对算法性能与稳定性有何影响?

主要发现

  • 在所有真实世界数据集上,S3COMP 和 S3COMP-C 的平均连通性(c̄)均显著高于 SSCOMP,其中在 MNIST70000 上提升达 0.1883,在 GTSRB 上提升达 0.1883。
  • 在 Extended Yale B 和 COIL100 上,S3COMP-C 的平均连通性分别为 0.0667 和 0.0077,分别优于 SSCOMP 的 0.0381 和 0.0060。
  • S3COMP-C 的聚类准确率在少数几次外层迭代内即趋于稳定,所有数据集上支持集大小在仅 2–3 次迭代后即稳定。
  • 当 λ 的取值范围在 [0.1, 1.0] 时,该方法对参数选择具有鲁棒性,尤其在连通性显著提升时,性能对 λ 的敏感度降低。
  • 在 MNIST4000(95.2%)、MNIST10000(94.8%)和 MNIST70000(94.5%)上,S3COMP-C 达到了最高聚类准确率,优于 SSCOMP 和 EnSC。
  • 通过频率加权平均的共识解(S3COMP*)相比简单平均,进一步提升了连通性和准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。