Skip to main content
QUICK REVIEW

[论文解读] Bipartite graph partitioning and data clustering

Hongyuan Zha, Xiaofeng He|ArXiv.org|Aug 27, 2001
Advanced Clustering Algorithms Research被引用 7
一句话总结

本文提出了一种新颖的双分图划分方法用于数据聚类,特别适用于文档和推荐系统数据,通过部分奇异值分解(SVD)最小化归一化切割准则。该方法实现了高效且全局最优的聚类,其准确性和鲁棒性优于K-means,并在不平衡和重叠聚类场景下达到或超越当前最先进方法的水平。

ABSTRACT

Many data types arising from data mining applications can be modeled as bipartite graphs, examples include terms and documents in a text corpus, customers and purchasing items in market basket analysis and reviewers and movies in a movie recommender system. In this paper, we propose a new data clustering method based on partitioning the underlying bipartite graph. The partition is constructed by minimizing a normalized sum of edge weights between unmatched pairs of vertices of the bipartite graph. We show that an approximate solution to the minimization problem can be obtained by computing a partial singular value decomposition (SVD) of the associated edge weight matrix of the bipartite graph. We point out the connection of our clustering algorithm to correspondence analysis used in multivariate analysis. We also briefly discuss the issue of assigning data objects to multiple clusters. In the experimental results, we apply our clustering algorithm to the problem of document clustering to illustrate its effectiveness and efficiency.

研究动机与目标

  • 解决具有固有双分结构(如词项与文档或用户与项目)的数据聚类挑战。
  • 开发一种基于图划分的高效、全局最优聚类方法,避免迭代算法中常见的局部极小值问题。
  • 建立谱聚类与经典多重变量分析技术(如对应分析)之间的联系。
  • 在存在重叠聚类和不平衡数据分布的情况下实现有效聚类。
  • 为传统向量空间模型聚类提供一种可扩展且理论基础坚实的替代方案。

提出的方法

  • 将数据聚类建模为双分图划分问题,其中词项和文档作为顶点,边权重表示共现频率。
  • 为双分图引入一种归一化切割准则,以偏好平衡划分并最小化簇间边权重。
  • 通过加权邻接矩阵的部分奇异值分解(SVD)推导近似解,实现高效计算。
  • 利用主导左、右奇异向量定义聚类分配,有效捕捉文档中的语义主题。
  • 将基于SVD的解与对应分析相联系,提供统计解释并加以验证。
  • 采用基于最小归一化切割的递归聚类策略,以确定切割点并优化聚类边界。

实验结果

研究问题

  • RQ1双分图的归一化切割准则是否能导出一种可行且有效的聚类方法?
  • RQ2如何通过部分SVD的谱松弛方法高效求解双分图划分问题?
  • RQ3所提出的基于SVD的聚类方法与多元统计中经典对应分析之间存在何种关系?
  • RQ4该方法在具有不平衡或重叠聚类的真实文档聚类任务中表现如何?
  • RQ5该方法能否在准确性和稳定性方面超越传统的K-means聚类?

主要发现

  • 在五类新闻组数据集上,该方法取得了88.2%的准确率,其余两个样本分别为85.4%和81.2%,显著优于此前在相同数据集上53–59%的结果。
  • 在平衡混合(50/50)的二元聚类中,该方法与K-means表现相当或略优;但在倾斜混合(50/100、50/150、50/200)中,该方法始终优于K-means,尤其在高不平衡场景下优势明显。
  • 该方法表现出强鲁棒性,标准差较低(如50/200混合下为7.58%),而K-means则表现出高变异性(如50/50下为12.83%),表明其易受局部极小值影响而产生不稳定性。
  • 基于部分SVD的方法提供了全局最优解,避免了基于EM的潜在语义分析和迭代K-means固有的局部极小值问题。
  • 与对应分析的关联验证了该方法的统计基础,并增强了聚类结果的可解释性。
  • 该算法有效处理了重叠聚类,生成了有意义的聚类标签,各聚类中的关键词反映了连贯的语义主题(如政治类聚类中为'亚美尼亚'、'以色列';科技类聚类中为'nasa'、'space')。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。