Skip to main content
QUICK REVIEW

[论文解读] Performance Analysis of Spectral Clustering on Compressed, Incomplete and Inaccurate Measurements

Blake Hunter, Thomas Strohmer|arXiv (Cornell University)|Nov 3, 2010
Sparse and Compressive Sensing Techniques参考文献 4被引用 19
一句话总结

该论文针对使用矩阵补全和压缩感知技术处理压缩、不完整且含噪声的数据时,对谱聚类的鲁棒性建立了理论边界。证明了由这些技术引起的亲和矩阵中的微小扰动,会导致谱坐标与真实坐标保持在 O(Nε) 以内,只要存在第 k 个特征值间隙,聚类可分性即可得以保持,并在人脸和手写数字等图像数据集上进行了验证。

ABSTRACT

Spectral clustering is one of the most widely used techniques for extracting the underlying global structure of a data set. Compressed sensing and matrix completion have emerged as prevailing methods for efficiently recovering sparse and partially observed signals respectively. We combine the distance preserving measurements of compressed sensing and matrix completion with the power of robust spectral clustering. Our analysis provides rigorous bounds on how small errors in the affinity matrix can affect the spectral coordinates and clusterability. This work generalizes the current perturbation results of two-class spectral clustering to incorporate multi-class clustering with k eigenvectors. We thoroughly track how small perturbation from using compressed sensing and matrix completion affect the affinity matrix and in succession the spectral coordinates. These perturbation results for multi-class clustering require an eigengap between the kth and (k+1)th eigenvalues of the affinity matrix, which naturally occurs in data with k well-defined clusters. Our theoretical guarantees are complemented with numerical results along with a number of examples of the unsupervised organization and clustering of image data.

研究动机与目标

  • 分析当数据不完整、含噪声或通过随机投影测量时,压缩感知和矩阵补全对谱聚类性能的影响。
  • 建立由于测量压缩或矩阵补全引起的亲和矩阵误差所导致的谱坐标扰动的严格理论边界。
  • 将现有的两分类谱聚类扰动结果推广至使用 k 个特征向量的多分类聚类。
  • 验证当第 k 个特征值间隙条件成立时,小扰动下聚类可分性得以保持,从而实现在压缩或不完整数据域中的无监督聚类。
  • 在真实世界图像数据集(包括人脸图像和手写数字)上展示实际可行性,仅需极少测量或缺失条目。

提出的方法

  • 使用随机投影(压缩感知)和核范数最小化(矩阵补全)从高维信号中恢复或估计缺失或压缩的数据。
  • 将亲和矩阵 A 的扰动建模为 |A(i,j) − Ã(i,j)| ≤ ε,其中 ε 源于测量或补全误差。
  • 应用特征向量扰动理论(如 Davis-Kahan 定理)来界定扰动亲和矩阵 Ã 的前 k 个特征向量与真实特征向量之间的偏差。
  • 推导出 Ã 的前 k 个特征向量张成的空间与真实空间之间的偏差为 O(Nε),且谱坐标与真实坐标的一个酉变换之间的偏差也为 O(Nε)。
  • 在扰动的谱坐标上应用 k-均值聚类,并表明聚类分配与未扰动情况下的偏差在 O(Nε) 范围内。
  • 通过在合成数据和真实图像数据(包括仅观测到 5% 条目的面部图像和压缩测量的手写数字)上的数值实验验证理论边界。

实验结果

研究问题

  • RQ1由压缩感知或矩阵补全引起的亲和矩阵中的微小扰动,如何影响聚类中使用的谱坐标?
  • RQ2当数据存在缺失条目或压缩测量时,谱聚类能否保持聚类可分性?在何种条件下可以?
  • RQ3在这些扰动下,谱坐标和聚类分配的偏差可以建立怎样的理论边界?
  • RQ4第 k 个特征值间隙如何影响在测量噪声和不完整性下多分类谱聚类的鲁棒性?
  • RQ5在经验上,压缩或不完整测量在多大程度上能保留图像数据中的潜在聚类结构?

主要发现

  • 扰动亲和矩阵 Ã 的前 k 个特征向量张成的空间与真实特征空间之间的偏差为 O(Nε),其中 ε 是 A 的最大逐元素扰动。
  • 从 Ã 衍生出的谱坐标与真实谱坐标的酉变换之间的偏差为 O(Nε),确保了结构的保持。
  • 在扰动坐标上通过 k-均值聚类得到的聚类分配与真实分配之间的偏差为 O(Nε),在满足 k-特征值间隙条件下保持了聚类可分性。
  • 在仅观测到 5% 条目的面部图像数据集中,矩阵补全后接谱聚类成功恢复了三人聚类结构。
  • 对手写数字数据,使用 32 个高斯测量的压缩谱聚类方法实现了与全图谱聚类相当的分类性能,2^8 次测量时误分类率为 0.1,而全数据需 2^13 次测量。
  • 随着压缩测量数量的增加,扰动亲和矩阵的前三个特征向量张成的空间逐渐收敛至真实空间,验证了理论误差边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。