[论文解读] Similarity Learning via Kernel Preserving Embedding
本文提出了一种名为核保持嵌入(Kernel Preserving Embedding, KPE)的新颖相似性学习框架,该框架通过最小化核矩阵的重构误差而非原始数据的重构误差,以保留全局流形结构。该方法在多个基准测试中实现了最先进(SOTA)的聚类性能,显著优于LRR、SSC和CAN等方法,尤其在低秩与稀疏表示任务中表现突出,且通过Wilcoxon符号秩检验验证了其统计显著性提升。
Data similarity is a key concept in many data-driven applications. Many algorithms are sensitive to similarity measures. To tackle this fundamental problem, automatically learning of similarity information from data via self-expression has been developed and successfully applied in various models, such as low-rank representation, sparse subspace learning, semi-supervised learning. However, it just tries to reconstruct the original data and some valuable information, e.g., the manifold structure, is largely ignored. In this paper, we argue that it is beneficial to preserve the overall relations when we extract similarity information. Specifically, we propose a novel similarity learning framework by minimizing the reconstruction error of kernel matrices, rather than the reconstruction error of original data adopted by existing work. Taking the clustering task as an example to evaluate our method, we observe considerable improvements compared to other state-of-the-art methods. More importantly, our proposed framework is very general and provides a novel and fundamental building block for many other similarity-based tasks. Besides, our proposed kernel preserving opens up a large number of possibilities to embed high-dimensional data into low-dimensional space.
研究动机与目标
- 为解决现有基于自表达的相似性学习方法仅关注原始数据重构而忽略流形结构的局限性。
- 通过核矩阵重构来保留数据中整体关系,从而改进相似性学习。
- 开发一种通用且灵活的框架,适用于多种基于相似性的学习任务,包括聚类与降维。
- 证明基于核的距离学习在捕捉数据内在结构方面优于传统数据重构方法。
- 为高维数据的低维嵌入提供一个鲁棒基础,以实现性能提升。
提出的方法
- 提出一种相似性学习框架,通过重构核矩阵而非原始数据矩阵,利用系数矩阵Z将每个数据点表示为其他样本的线性组合。
- 最小化原始核矩阵K与重构核矩阵KZ之间差值的Frobenius范数,即||K - KZ||_F^2。
- 引入包含核范数||Z||_*的正则化项以促进低秩结构,以及ℓ1-范数||Z||_1以鼓励稀疏性。
- 通过将学习得到的Z用作谱聚类中的相似性矩阵,将该方法应用于聚类任务。
- 使用参数γ来平衡优化目标中的重构误差与正则化项。
- 采用高斯核或其他核函数计算初始核矩阵K,该核矩阵在嵌入过程中得以保持。
实验结果
研究问题
- RQ1在相似性学习过程中保留核矩阵是否能带来比重构原始数据更优的表征学习效果?
- RQ2基于核的相似性学习与传统自表达方法相比,在捕捉流形结构方面表现如何?
- RQ3所提出的框架是否能在聚类与降维等不同基于相似性的任务中实现良好泛化?
- RQ4正则化参数γ对模型性能与鲁棒性有何影响?
- RQ5核保持嵌入能否在聚类基准测试中超越SOTA方法如LRR、SSC与CAN?
主要发现
- SLKE在大多数基准数据集上实现了最佳聚类准确率与NMI,相较于LRR与SSC的平均准确率分别提升8.92%与8.76%。
- Wilcoxon符号秩检验显示,SLKE-S与SLKE-R相较于SC、RKKM、SSC、LRR、SSR、CAN与TLSC的p值均小于0.05,表明结果具有统计显著性。
- SLKE-R与SLKE-S在所有数据集上的平均准确率分别较LRR与SSC高出8.92%与8.76%。
- 该方法对参数γ具有鲁棒性,在γ从10^-6到10^-3的广泛范围内均保持优异性能。
- t-SNE可视化结果表明,SLKE能够有效保持数据的聚类结构,尤其在JAFFE数据集上,重构数据维持了清晰的可分性。
- 在COIL20数据集上,SLKE的性能几乎与CAN相当,显示出在具有挑战性的数据场景下依然具备强大竞争力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。