[论文解读] Spectral Perturbation Meets Incomplete Multi-view Data
该论文提出了一种新型方法——扰动导向的不完全多视图聚类(PIC),该方法将多视图数据中的特征缺失转化为相似性矩阵的缺失,并利用谱扰动理论最小化视图间的扰动风险,从而实现鲁棒的共识聚类。PIC在合成数据集和真实世界不完全多视图数据集上均优于当前最先进方法,通过联合完成相似性矩阵并利用扰动感知加权学习鲁棒的共识拉普拉斯矩阵,实现性能提升。
Beyond existing multi-view clustering, this paper studies a more realistic clustering scenario, referred to as incomplete multi-view clustering, where a number of data instances are missing in certain views. To tackle this problem, we explore spectral perturbation theory. In this work, we show a strong link between perturbation risk bounds and incomplete multi-view clustering. That is, as the similarity matrix fed into spectral clustering is a quantity bounded in magnitude O(1), we transfer the missing problem from data to similarity and tailor a matrix completion method for incomplete similarity matrix. Moreover, we show that the minimization of perturbation risk bounds among different views maximizes the final fusion result across all views. This provides a solid fusion criteria for multi-view data. We motivate and propose a Perturbation-oriented Incomplete multi-view Clustering (PIC) method. Experimental results demonstrate the effectiveness of the proposed method.
研究动机与目标
- 解决不完全多视图聚类中的实际挑战,即某些数据实例在特定视图中缺失,违反了强完整采样假设。
- 克服现有方法简单地用平均值填补缺失特征所带来的局限性,此类方法可能扭曲类间与类内方差。
- 建立谱扰动风险与不完全多视图聚类之间的理论联系,以指导跨视图的鲁棒融合。
- 提出一种新聚类框架,基于完成的相似性矩阵运行,并利用扰动理论对视图进行加权,以实现共识表示学习。
提出的方法
- 通过从原始数据构建各视图特有的相似性矩阵,将缺失的特征值转化为缺失的相似性条目。
- 利用包含对应实例的其他视图中的平均相似性值来填补缺失的相似性条目。
- 为每个完成的相似性矩阵计算拉普拉斯矩阵,以表示每个视图的图结构。
- 应用谱扰动理论推导出扰动风险上界,并利用该上界对每个拉普拉斯矩阵进行加权,以最小化视图间的特征子空间差异。
- 将加权后的拉普拉斯矩阵融合为一个共识拉普拉斯矩阵,基于扰动风险平衡所有视图。
- 在最终的共识拉普拉斯矩阵上执行谱聚类,以获得统一的聚类结果。
实验结果
研究问题
- RQ1能否利用谱扰动理论来建模并最小化不完全数据下多视图聚类中的不一致性风险?
- RQ2将缺失数据问题从特征空间转移到相似性空间,是否能带来更鲁棒的聚类性能?
- RQ3基于谱稳定性的扰动感知融合策略,能否通过视图加权提升不完全多视图数据上的聚类准确率?
- RQ4所提出方法在合成与真实世界不完全多视图数据集上,与现有矩阵补全和聚类基线相比表现如何?
主要发现
- 在合成数据集上,PIC在所有部分样本比例(PER)设置下显著优于所有基线方法,包括近期方法DAIMC,ACC与NMI指标均保持一致提升。
- 在三个真实世界不完全多视图数据集上,PIC在ACC与NMI上的平均表现均最优,展现出更强的鲁棒性与泛化能力。
- 该方法在不同数据不完整程度下均保持优异性能,当扰动参数 $\tilde{\beta}$ 设为 0.1 时取得最佳结果。
- 参数研究证实,平衡方案 $\beta = \tilde{\beta} \times \|\sum_{v}\mathbf{Q}^{v}\|_F / \|\mathbf{I}\|_F$ 允许单一 $\tilde{\beta}$ 值在多种数据集上均有效。
- 多视图聚类方法(包括PIC)始终优于两视图与单视图基线,证实即使在不完整情况下,利用多视图仍具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。