[论文解读] Neural Collaborative Subspace Clustering
本文提出神经协同子空间聚类(NCSC),一种深度学习框架,用神经分类器替代谱聚类,实现可扩展的端到端子空间聚类。通过协同训练分类器以预测成对样本的子空间隶属关系,以及自表达层以从其他样本重构数据点,NCSC 在 MNIST、Fashion-MNIST 和 Stanford Online Products 数据集上实现了最先进性能,无需使用谱聚类,Fashion-MNIST 上准确率达到 72.14%,Stanford 数据集上达到 27.5%。
We introduce the Neural Collaborative Subspace Clustering, a neural model that discovers clusters of data points drawn from a union of low-dimensional subspaces. In contrast to previous attempts, our model runs without the aid of spectral clustering. This makes our algorithm one of the kinds that can gracefully scale to large datasets. At its heart, our neural model benefits from a classifier which determines whether a pair of points lies on the same subspace or not. Essential to our model is the construction of two affinity matrices, one from the classifier and the other from a notion of subspace self-expressiveness, to supervise training in a collaborative scheme. We thoroughly assess and contrast the performance of our model against various state-of-the-art clustering algorithms including deep subspace-based ones.
研究动机与目标
- 解决依赖谱聚类和亲和矩阵计算的传统子空间聚类方法在可扩展性方面的局限性。
- 开发一种基于深度学习的方法,消除对谱聚类的依赖,同时保持或提升聚类性能。
- 通过引入两个互补模块之间的协同学习框架,实现神经网络在子空间聚类中的端到端训练。
- 在大规模且复杂的数据集上展示鲁棒性与可扩展性,包括具有非线性结构和高视觉差异性的数据集。
提出的方法
- 将子空间聚类建模为二分类任务,以判断一对数据点是否位于同一子空间。
- 构建两个亲和矩阵:一个来自分类器(A_c)预测的同子空间对,另一个来自子空间自表达性(A_s),其中每个数据点通过其他点的线性组合进行重构。
- 通过协同优化方案联合训练两个模块,其中每个亲和矩阵利用高置信度预测来监督另一个。
- 使用自表达矩阵 A_s 作为正则化项以提升分类器的泛化能力,反之亦然,实现相互优化。
- 采用小批量训练方式,实现对大规模数据集的高效扩展,无需存储完整的亲和矩阵。
- 直接从训练好的网络预测最终聚类标签,无需通过谱聚类进行后处理。
实验结果
研究问题
- RQ1是否可以训练一个神经网络在不依赖谱聚类或亲和矩阵计算的情况下完成子空间聚类?
- RQ2如何有效结合基于分类器的亲和性与基于自表达性的亲和性,以提升聚类性能?
- RQ3分类器与自表达层之间的协同训练是否能带来比现有深度子空间聚类方法更高的聚类准确率与可扩展性?
- RQ4所提出方法在具有挑战性、非线性和高变异性数据集(如 Stanford Online Products)上的表现如何?
主要发现
- 在 Fashion-MNIST 上,NCSC 达到 72.14% 的聚类准确率,显著优于次佳方法(DSC-Net 的 60.62%),甚至超过非深度方法如 DAC 和 ClusterGAN。
- 在极具挑战性的 Stanford Online Products 数据集上,NCSC 达到 27.5% 的准确率,优于大多数深度聚类基线方法,包括 DEC、DCN 和 InfoGAN,后三者性能较差或甚至劣于初始化状态。
- 只要潜在维度支持子空间自表达性,模型对网络架构变化表现出鲁棒性,表明其具有良好的架构灵活性。
- 协同训练方案逐步提升分类器与自表达组件的性能,通过相互监督机制实现彼此增强。
- NCSC 消除了谱聚类带来的 O(n²) 内存与计算瓶颈,实现在大规模数据集上的可扩展训练,且不损失性能。
- 在 MNIST 上,NCSC 达到 72.14% 的准确率,比 SSC-CAE(35.87%)高出 11.5 个百分点,证实其在标准基准上的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。