Skip to main content
QUICK REVIEW

[论文解读] An Information-theoretic Perspective of Hierarchical Clustering

Yicheng Pan, Feng Zheng|arXiv (Cornell University)|Aug 13, 2021
Advanced Clustering Algorithms Research参考文献 12被引用 5
一句话总结

该论文提出HCSE,一种新颖的层次聚类算法,基于结构熵的信息理论目标函数,无需超参数即可自然确定层次结构的层级数量。通过递归地对聚类树中最稀疏的层级应用拉伸和压缩操作进行分层,HCSE在合成数据上识别内在层次结构方面优于LOUVAIN和HLP,并在真实网络上实现了具有竞争力的代价,尤其在保持结构平衡和最小化基于结构熵的代价方面表现优异。

ABSTRACT

A combinatorial cost function for hierarchical clustering was introduced by Dasgupta \cite{dasgupta2016cost}. It has been generalized by Cohen-Addad et al. \cite{cohen2019hierarchical} to a general form named admissible function. In this paper, we investigate hierarchical clustering from the \emph{information-theoretic} perspective and formulate a new objective function. We also establish the relationship between these two perspectives. In algorithmic aspect, we get rid of the traditional top-down and bottom-up frameworks, and propose a new one to stratify the \emph{sparsest} level of a cluster tree recursively in guide with our objective function. For practical use, our resulting cluster tree is not binary. Our algorithm called HCSE outputs a $k$-level cluster tree by a novel and interpretable mechanism to choose $k$ automatically without any hyper-parameter. Our experimental results on synthetic datasets show that HCSE has a great advantage in finding the intrinsic number of hierarchies, and the results on real datasets show that HCSE also achieves competitive costs over the popular algorithms LOUVAIN and HLP.

研究动机与目标

  • 为解决层次聚类中可接受代价函数的局限性,这些函数倾向于产生不平衡的树结构,且缺乏对内在层次结构的自然检测能力。
  • 开发一种基于信息理论的目标函数,其本身能促进平衡的聚类树,与自然层次结构的认知和结构直觉相一致。
  • 设计一种聚类算法,能够自动确定层级数量,而无需依赖超参数。
  • 通过结构熵建立组合代价函数(如Dasgupta)与信息理论原则之间的桥梁。
  • 通过在聚类过程中整合平衡性与可解释性,改进现有启发式算法(如LOUVAIN和HLP)

提出的方法

  • 基于李和潘的理论,提出一种基于结构熵的新代价函数,用于量化层次网络的复杂性。
  • 定义一种新颖的目标函数,将树的平衡性作为自然因素纳入其中,灵感源自最优编码理论。
  • 引入两种原子操作——“拉伸”和“压缩”——以递归识别并优化聚类树中最稀疏的层级。
  • 开发一种递归分层框架,避免传统的自顶向下或自底向上聚类方法,转而聚焦于最稀疏层级的优化。
  • 设计一种基于结构熵的自动停止准则,无需超参数即可识别内在的层级数量。
  • 将HCSE实现为一种通用框架,兼容任意代价函数,重点是最小化结构熵并生成平衡、可解释的树结构。

实验结果

研究问题

  • RQ1基于结构熵的信息理论目标函数是否能为层次聚类提供比可接受代价函数更自然、更平衡的替代方案?
  • RQ2代价函数生成函数g需满足何种条件,才能在团图中实现最优聚类树的完全平衡?
  • RQ3在均匀加权团图中,实现最优聚类树完全平衡的充要条件是什么?
  • RQ4如何在无需超参数的情况下,自动且可解释地确定层级数量?
  • RQ5像结构熵这样非线性且与体积相关的代价函数,能否在具有近似保证的前提下被有效优化?

主要发现

  • 在k层HSBM模型生成的合成数据集上,HCSE在识别真实层级数量方面显著优于LOUVAIN和HLP,展现出卓越的内在层次结构检测能力。
  • 在真实世界网络中,HCSE在10个网络中的8个实现了最低的结构熵代价(cost(SE)),并在所有测试数据集中保持了具有竞争力的Dasgupta代价(cost(Das))。
  • 在CSphd网络的最大子图上,HCSE的平均Jaccard指数达到0.20,优于HLP(0.16)和LOUVAIN(0.17),表明其与真实聚类的对齐性更优。
  • 对于层级数量相近(±1或2)的网络,HCSE在所有情况下均实现了最佳的cost(Das),而LOUVAIN仅在少数情况下因树更深而表现更优。
  • 该算法无需超参数即可自动确定层级数量,结果在不同数据集上表现出一致且可解释的层次深度。
  • HLP在所有指标上均无法超越HCSE或LOUVAIN,表明其启发式特性导致在平衡性和代价最小化方面均表现次优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。