Skip to main content
QUICK REVIEW

[论文解读] Document Clustering Based On Max-Correntropy Non-Negative Matrix Factorization

Le Li, Jianjun Yang|arXiv (Cornell University)|Oct 3, 2014
Face and Expression Recognition参考文献 26被引用 8
一句话总结

本文提出了一种新型文档聚类方法——最大相关性非负矩阵分解(MCC-NMF),通过最大化原始文档矩阵与其低秩近似之间的相关性,提升在非线性、高维数据上的性能。MCC-NMF 在 Reuters21578 和 TDT2 数据集上优于使用 $l_2$ 或 KL 散度的传统 NMF 变体,尤其在主题数量增加时表现出更优的准确性和鲁棒性。

ABSTRACT

Nonnegative matrix factorization (NMF) has been successfully applied to many areas for classification and clustering. Commonly-used NMF algorithms mainly target on minimizing the $l_2$ distance or Kullback-Leibler (KL) divergence, which may not be suitable for nonlinear case. In this paper, we propose a new decomposition method by maximizing the correntropy between the original and the product of two low-rank matrices for document clustering. This method also allows us to learn the new basis vectors of the semantic feature space from the data. To our knowledge, we haven't seen any work has been done by maximizing correntropy in NMF to cluster high dimensional document data. Our experiment results show the supremacy of our proposed method over other variants of NMF algorithm on Reuters21578 and TDT2 databasets.

研究动机与目标

  • 为解决标准 NMF 算法依赖 $l_2$ 或 KL 散度而可能在非线性、高维文档数据上表现不佳的问题。
  • 探索相关性最大化作为 NMF 中新目标函数的潜力,以提升文档聚类性能。
  • 评估所提方法在主题数量增加和更高维数据下的鲁棒性与可扩展性。
  • 在真实世界文档聚类任务中,证明基于相关性的 NMF 优于现有 NMF 变体。

提出的方法

  • 该方法将文档聚类建模为非负矩阵分解问题,将文档-词矩阵 $X$ 分解为两个低秩非负矩阵 $W$ 和 $H$,使得 $X \approx WH$。
  • 与最小化 $l_2$ 或 KL 散度不同,其核心创新在于最大化 $X$ 与 $WH$ 之间的相关性,从而增强对异常值的鲁棒性并捕捉非线性关系。
  • 通过迭代算法进行优化,利用梯度上升法更新 $W$ 和 $H$,同时确保非负性约束得以保持。
  • 该方法自适应地学习基于核的表示,使其能够自动学习相关特征,并在复杂、非线性的数据分布上提升聚类性能。
  • 采用投影梯度法实现算法,以在优化过程中保持非负性。
  • 最终聚类标签通过 Kuhn-Munkres 算法分配,以匹配预测聚类与真实主题。

实验结果

研究问题

  • RQ1在高维、非线性数据上,与基于 $l_2$ 和 KL 散度的标准 NMF 方法相比,最大化相关性是否能提升文档聚类性能?
  • RQ2随着主题数量的增加,所提出的 MCC-NMF 方法在鲁棒性和准确率衰减方面表现如何?
  • RQ3基于相关性的目标函数是否能实现更好的潜在语义空间中的特征学习与表示?
  • RQ4在多个数据集上,MCC-NMF 与 GS-CLS 和 PG-NMF 等先进 NMF 变体相比,聚类准确率如何?

主要发现

  • 在 Reuters21578 数据集上,MCC-NMF 在 $K=2$ 时达到 0.911 的聚类准确率,显著优于 $l_2$(0.839)、KL(0.871)、GS-CLS(0.894)和 PG(0.838)变体。
  • 在 TDT2 数据集上,MCC-NMF 在 $K=2$ 时达到 0.927 的准确率,超过 $l_2$(0.824)、KL(0.845)、GS-CLS(0.881)和 PG(0.863)方法。
  • 当聚类数增加到 $K=10$ 时,MCC-NMF 在 Reuters21578 上仍保持 0.736 的高准确率,显著高于 $l_2$(0.403)、KL(0.457)、GS-CLS(0.719)和 PG(0.415)。
  • MCC-NMF 在 $K$ 增加时表现出最强的鲁棒性,准确率下降最缓慢,表明其具有优越的可扩展性。
  • 该方法在 Reuters21578 和 TDT2 两个数据集上始终优于所有基线方法,尤其在多主题和高维设置下表现更优。
  • 结果证实,相关性最大化相比传统损失函数,在文档聚类中能实现更优的非线性特征表示与聚类性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。