[论文解读] Supervised Hierarchical Clustering with Exponential Linkage
本文提出了一种监督层次聚类的联合训练框架,通过将相异度函数学习与一种新型的指数链接(ExpLink)族链接函数紧密耦合,该链接函数在单链接、平均链接和完全链接之间实现平滑插值。通过在内层使用HAC(层次聚类算法)的同时,利用梯度下降对ExpLink进行优化,该方法在训练-聚类目标不匹配的情况下,将树状图纯度提升了最多8个百分点,消除了手动选择链接函数的需要。
In supervised clustering, standard techniques for learning a pairwise dissimilarity function often suffer from a discrepancy between the training and clustering objectives, leading to poor cluster quality. Rectifying this discrepancy necessitates matching the procedure for training the dissimilarity function to the clustering algorithm. In this paper, we introduce a method for training the dissimilarity function in a way that is tightly coupled with hierarchical clustering, in particular single linkage. However, the appropriate clustering algorithm for a given dataset is often unknown. Thus we introduce an approach to supervised hierarchical clustering that smoothly interpolates between single, average, and complete linkage, and we give a training procedure that simultaneously learns a linkage function and a dissimilarity function. We accomplish this with a novel Exponential Linkage function that has a learnable parameter that controls the interpolation. In experiments on four datasets, our joint training procedure consistently matches or outperforms the next best training procedure/linkage function pair and gives up to 8 points improvement in dendrogram purity over discrepant pairs.
研究动机与目标
- 为解决因训练目标与聚类算法不匹配而导致的监督层次聚类性能下降问题。
- 开发一种统一的训练流程,联合学习适用于聚类算法的相异度函数与链接函数。
- 引入一种可微分、可学习的链接函数族,可在单链接、平均链接和完全链接之间实现平滑插值。
- 通过在训练过程中端到端学习链接函数,消除实践者预先选择链接函数的需求。
- 通过实证验证,匹配训练目标与聚类目标可显著提升真实世界数据集上的聚类质量。
提出的方法
- 提出指数链接(ExpLink)族,其中链接权重通过指数缩放的成对相异度上的Softmax计算得出。
- 在内层使用可微分的HAC变体,以计算相异度函数和ExpLink参数的梯度。
- 采用损失函数,惩罚HAC多轮迭代过程中不纯的合并操作,促进形成高纯度聚类。
- 通过梯度下降联合优化ExpLink超参数与成对相异度函数参数。
- 基于其在HAC过程中对高纯度聚合的贡献程度选择训练样本,以提升泛化能力。
- 使用改进的HAC算法,在训练过程中追踪并优化树状图纯度。
实验结果
研究问题
- RQ1一种将训练目标与聚类算法对齐的联合训练流程,是否能提升层次聚类性能?
- RQ2一种在单链接、平均链接和完全链接之间插值的可学习链接函数,是否优于固定链接选择?
- RQ3对相异度函数与链接参数进行端到端优化,是否能消除对手动选择链接函数的需求?
- RQ4所提出方法在多种数据集上与标准全对训练和固定链接变体相比,性能如何?
- RQ5匹配训练目标与聚类目标在多大程度上能减少导致聚类质量下降的差异?
主要发现
- 所提出的联合训练流程在四个数据集上始终与或优于次优的训练流程/链接函数组合。
- 与训练-聚类目标不匹配的情况相比,该方法在树状图纯度上最高提升8个百分点,证明了目标对齐的重要性。
- 指数链接族实现了单链接、平均链接和完全链接之间的平滑插值,最优链接在训练过程中自动选择。
- 针对单链接设计的专用训练算法在所有四个数据集上均显著优于标准全对训练。
- 联合优化框架减少了对手动超参数调优的需求,特别是链接选择方面,使其在真实世界应用中更具实用性。
- 实证结果表明,即使在事先未知最优链接的情况下,匹配训练与聚类目标也能带来更优的泛化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。