[论文解读] One-Pass Incomplete Multi-view Clustering
本文提出OPIMC,一种用于大规模不完整多视图聚类的一次性框架,通过引入正则化和加权矩阵分解高效处理缺失样本。通过引入两种全局统计量,OPIMC实现直接聚类输出与早期收敛检测,在四个真实世界数据集上实现最先进性能,同时显著降低时间和内存消耗。
Real data are often with multiple modalities or from multiple heterogeneous sources, thus forming so-called multi-view data, which receives more and more attentions in machine learning. Multi-view clustering (MVC) becomes its important paradigm. In real-world applications, some views often suffer from instances missing. Clustering on such multi-view datasets is called incomplete multi-view clustering (IMC) and quite challenging. To date, though many approaches have been developed, most of them are offline and have high computational and memory costs especially for large scale datasets. To address this problem, in this paper, we propose an One-Pass Incomplete Multi-view Clustering framework (OPIMC). With the help of regularized matrix factorization and weighted matrix factorization, OPIMC can relatively easily deal with such problem. Different from the existing and sole online IMC method, OPIMC can directly get clustering results and effectively determine the termination of iteration process by introducing two global statistics. Finally, extensive experiments conducted on four real datasets demonstrate the efficiency and effectiveness of the proposed OPIMC method.
研究动机与目标
- 解决现有离线方法在处理大规模多视图数据集时因计算和内存成本过高而难以应对缺失样本的挑战。
- 开发一种在线、可扩展的不完整多视图聚类解决方案,避免重复处理数据并降低时间复杂度。
- 实现直接聚类输出与自动收敛检测,无需依赖迭代验证或固定遍历次数。
- 在多视图数据常出现缺失的实际应用中,提升鲁棒性与效率。
- 提供适用于流式处理或大规模数据场景(如网络挖掘和视频分析)的实用框架。
提出的方法
- OPIMC采用正则化矩阵分解(RMF)从不完整多视图数据中学习低秩表示,保持视图间的一致性。
- 通过在优化过程中为未见样本分配较低权重,使用加权矩阵分解(WMF)处理缺失条目。
- 引入两种全局统计量——累积损失与聚类中心稳定性,用于监控收敛并实现迭代过程的早期终止。
- 该框架以块为单位处理数据(分块处理),实现最小内存占用的一次性学习。
- 目标函数整合了视图特定的重建误差、因子矩阵的正则化项,以及一个平衡参数 α,用于控制数据保真度与平滑性之间的权衡。
- OPIMC按数据块增量更新因子矩阵,适用于流式或大规模数据处理。
实验结果
研究问题
- RQ1一次性框架能否在大规模数据集上以高可扩展性和低内存占用有效处理不完整多视图聚类?
- RQ2如何利用全局统计量自动确定收敛,而无需完整数据遍历或验证?
- RQ3正则化与加权矩阵分解的结合在不完整多视图数据上的聚类性能提升程度如何?
- RQ4在一次性设置下,块大小对聚类准确率与收敛速度有何影响?
- RQ5在处理过程中填充退化的聚类中心是否能显著提升聚类稳定性和性能?
主要发现
- OPIMC在四个真实世界数据集(WebKB、Digit、Reuters 和 YouTube)上实现了最先进聚类性能,优于现有离线与在线方法。
- 聚类性能的最优超参数 α 在 WebKB 上为 10,Digit 上为 0.1,Reuters 上为 0.01,YouTube 上为 1,表明对不同视图具有特定敏感性。
- 通过两种全局统计量可靠检测收敛,平均损失在 5–10 次遍历后趋于稳定,NMI 与调整兰德指数(AC)也与损失收敛同步达到稳定值。
- 在 Digit 数据集上,较大的块大小(如 s=250)可获得更优聚类结果,但伴随更高的内存消耗。
- 在处理过程中填充退化聚类中心(OPIMC-F)相比未填充版本(OPIMC-NF)显著提升聚类性能,证明了中心稳定性在在线学习中的重要性。
- 与离线方法相比,该方法显著缩短聚类时间,由于有效的早期停止机制,收敛在更少遍历次数内实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。