[论文解读] Hierarchical Clustering for Euclidean Data
本文提出了一种基于高斯核的可扩展分层聚类算法,用于欧几里得数据,引入了投影随机切割(PRC)并分析了低维与高维下的平均链接聚类。该方法将 Moseley-Wang 目标函数的近似比从 1/3 提升至 1D 情况下的 1/2,并在大规模数据集(如 SIFT10M)上实现了线性时间性能,其运行速度优于平均链接聚类和谱聚类,同时保持了具有竞争力的目标函数值。
Recent works on Hierarchical Clustering (HC), a well-studied problem in exploratory data analysis, have focused on optimizing various objective functions for this problem under arbitrary similarity measures. In this paper we take the first step and give novel scalable algorithms for this problem tailored to Euclidean data in R^d and under vector-based similarity measures, a prevalent model in several typical machine learning applications. We focus primarily on the popular Gaussian kernel and other related measures, presenting our results through the lens of the objective introduced recently by Moseley and Wang [2017]. We show that the approximation factor in Moseley and Wang [2017] can be improved for Euclidean data. We further demonstrate both theoretically and experimentally that our algorithms scale to very high dimension d, while outperforming average-linkage and showing competitive results against other less scalable approaches.
研究动机与目标
- 为解决缺乏针对基于向量相似性度量(特别是高斯核)的欧几里得数据的面向目标的算法问题。
- 在一般相似性设置下,改进平均链接聚类对 Moseley-Wang 目标函数的 1/3-近似保证。
- 设计快速、可扩展的算法,以利用高维欧几里得数据中的几何结构进行分层聚类。
- 通过理论和实验验证,证明平均链接聚类及新型算法(如 PRC)在大规模数据集上的近似质量与运行时间方面优于现有方法。
- 证明在结构化设置(如 1D 欧几里得数据)下,近似因子可超越 1/3,即使在一般方法受限的情况下亦然。
提出的方法
- 提出投影随机切割(PRC),一种线性时间算法:将高维数据投影到一条随机线上,对投影结果排序,并执行随机切割以构建分层聚类树。
- 分析 1D 欧几里得数据中的平均链接聚类,证明其对 Moseley-Wang 目标函数实现 1/2-近似,优于一般情况下的 1/3 边界。
- 引入 1D-SUM 上界作为 1D 情况下最优目标值的理论上限,用于评估近似比。
- 采用基于降维的方法,在特定条件下模拟任意相似性矩阵,从而支持聚焦于欧几里得结构的合理性。
- 以高斯核相似性 $ w_{ij} = \exp(-\|v_i - v_j\|^2 / 2\sigma^2) $ 作为主要相似性度量,$\sigma$ 通过经验启发式方法调优。
- 使用谱聚类和 MAX-upper 作为目标值比较的基准,并采用单次遍历数据处理策略以实现可扩展性。
实验结果
研究问题
- RQ1在结构化数据设置(如 1D 欧几里得数据)下,平均链接聚类的 1/3-近似保证能否得到改进?
- RQ2能否为高维欧几里得数据设计可扩展的算法,同时保持强近似保证?
- RQ3具有高斯核相似性的欧几里得数据的几何结构是否允许比一般相似性矩阵获得更好的近似?
- RQ4在真实世界数据集上,PRC 在目标值和运行时间方面与平均链接聚类和谱聚类相比表现如何?
- RQ5带宽参数 $\sigma$ 对算法近似质量与稳定性有何影响?
主要发现
- 在 Zoo 数据集(100 个样本,16D)上,投影随机切割(PRC)的近似比最高达到 0.92,其运行速度和目标值均优于平均链接聚类与谱聚类。
- 在 SIFT10M 数据集(1000 万个样本,128D)上,PRC 仅耗时 1592 秒,运行时间几乎与数据规模呈线性关系,接近单次数据遍历的时间。
- 在 1D 欧几里得数据中,随机切割与平均链接聚类均对 Moseley-Wang 目标函数实现 1/2-近似,优于一般情况下的 1/3 边界。
- 理论分析表明,在 1D-SUM 上界下,平均链接聚类在 1D 中无法超过 1/2-近似,说明 1/2 是该设置下的紧致边界。
- 对于高维数据且带宽 $\sigma$ 较小时,平均链接聚类仍无法突破 1/3-近似,表明需对 $\sigma$ 或维度施加结构假设才能实现性能提升。
- 在 Zoo 数据集上,$\sigma$ 取值范围 [1.5, 5] 时,能平衡对距离差异的敏感性与相似性均匀性,最优性能出现在 $\sigma=5$。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。