[论文解读] Semi-supervised Spectral Clustering for Classification
本文提出了一种新颖的分类聚类(CVC)框架,通过利用半监督谱聚类从共聚类的训练和测试数据中学习类别-聚类分布,以提升图像集分类性能。结合直接Fiedler向量计算(DFVC)算法与Grassmannian流形表示,该方法在五个标准数据集上实现了最先进准确率,且显著快于现有方法。
We propose a Classification Via Clustering (CVC) algorithm which enables existing clustering methods to be efficiently employed in classification problems. In CVC, training and test data are co-clustered and class-cluster distributions are used to find the label of the test data. To determine an efficient number of clusters, a Semi-supervised Hierarchical Clustering (SHC) algorithm is proposed. Clusters are obtained by hierarchically applying two-way NCut by using signs of the Fiedler vector of the normalized graph Laplacian. To this end, a Direct Fiedler Vector Computation algorithm is proposed. The graph cut is based on the data structure and does not consider labels. Labels are used only to define the stopping criterion for graph cut. We propose clustering to be performed on the Grassmannian manifolds facilitating the formation of spectral ensembles. The proposed algorithm outperformed state-of-the-art image-set classification algorithms on five standard datasets.
研究动机与目标
- 弥合无监督聚类与有监督分类之间的差距,其中聚类结果通常跨越类别边界。
- 开发一种通用的分类框架,利用聚类结果而无需要求唯一类别-聚类对应关系。
- 在半监督方式下确定最优聚类数,仅使用标签信息作为停止准则。
- 通过一种新型特征值求解器,直接计算仅需的Fiedler向量,从而加速谱聚类。
- 提升在图像集分类任务中对异常值的鲁棒性与可扩展性。
提出的方法
- CVC使用基于归一化图切分的半监督分层聚类(SHC)算法,对训练和测试数据进行共聚类。
- SHC利用归一化图拉普拉斯矩阵的Fiedler向量符号递归地对聚类进行分割,标签仅用于终止该过程。
- 提出一种直接Fiedler向量计算(DFVC)算法,通过位移逆迭代法高效计算第二小的特征向量。
- 将数据映射到Grassmannian流形,以支持在多种流形表示之间进行谱集成学习。
- 通过类别概率分布在聚类上的分布距离度量执行分类。
- 应用模式融合以结合来自不同维度流形的多个分类器,实现早期停止与加速。
实验结果
研究问题
- RQ1当聚类本身跨越多个类别时,聚类能否有效用于分类?
- RQ2如何在不强制在目标函数中施加类别边界的情况下,最优地确定聚类数量?
- RQ3是否可以无需计算所有特征向量而高效计算Fiedler向量,特别是在仅需符号进行分割时?
- RQ4对训练和测试数据进行共聚类是否能比局部分类方法带来更好的泛化性能?
- RQ5所提方法在图像集分类任务中对数据异常值和噪声样本的鲁棒性如何?
主要发现
- 所提出的CVC算法结合SHC与DFVC,在五个标准数据集上优于全部七种最先进图像集分类算法。
- 在包含19%、38%和57%画廊集异常值的Honda数据集中,CVC算法实现了100%的识别准确率。
- 对于探针集包含1–3张异常图像的情况,CVC算法分别实现了100%、100%和97.43%的识别率。
- SHC算法在平均上分别比k-means、SSC和SKMS快1.33倍、3.38倍和16.47倍,最大加速比分别为3.77倍、7.03倍和47.0倍。
- 当存在低成本切分时,DFVC算法收敛迅速,显著降低了有利情况下的计算成本。
- 模式融合在多数低维分类器达成一致时实现早期终止,加速了分类过程且未牺牲准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。