Skip to main content
QUICK REVIEW

[论文解读] Fast and Accurate $k$-means++ via Rejection Sampling

Vincent Cohen-Addad, Silvio Lattanzi|arXiv (Cornell University)|Dec 22, 2020
Data Management and Algorithms被引用 5
一句话总结

本文提出了一种近线性时间的 k-means++ 初始化算法,利用多树嵌入和拒绝采样,在保持与 k-means++ 相同的 O(log k) 近似保证的同时显著提升了运行速度。通过树结构近似距离,并利用基于 LSH 的拒绝采样校正采样偏差,该方法的运行时间为 Õ(nd + (n log Δ)^{1+ε}),在大 k 情况下相比 k-means++ 和 Afkmc2 最快可提升一个数量级,且保持了解的质量。

ABSTRACT

$k$-means++ \cite{arthur2007k} is a widely used clustering algorithm that is easy to implement, has nice theoretical guarantees and strong empirical performance. Despite its wide adoption, $k$-means++ sometimes suffers from being slow on large data-sets so a natural question has been to obtain more efficient algorithms with similar guarantees. In this paper, we present a near linear time algorithm for $k$-means++ seeding. Interestingly our algorithm obtains the same theoretical guarantees as $k$-means++ and significantly improves earlier results on fast $k$-means++ seeding. Moreover, we show empirically that our algorithm is significantly faster than $k$-means++ and obtains solutions of equivalent quality.

研究动机与目标

  • 开发一种更快的 k-means++ 初始化算法,保持强理论保证的同时可扩展至大规模数据集。
  • 克服先前快速 k-means++ 方法在中等至大 k 情况下面临的 Ω(k²) 运行时间瓶颈。
  • 在不牺牲解质量的前提下,实现近线性时间复杂度 Õ(nd + (n log Δ)^{1+ε})。
  • 通过基于 LSH 的最近邻估计实现拒绝采样,确保算法输出的分布与原始 k-means++ 的 D² 分布一致。
  • 通过实验验证,该方法在保持与 k-means++ 和 Afkmc2 相当的聚类代价的同时,显著快于二者。

提出的方法

  • 该方法使用多树嵌入来近似点之间的平方欧几里得距离,从而在树距离上实现快速的 D² 采样。
  • 提出 Fastk-means++,利用树近似距离在 Õ(nd) 时间内完成初始化计算。
  • 应用拒绝采样以校正近似误差:仅当候选点到当前中心集合的真实距离在树估计距离的因子 c 以内时,才接受该点。
  • 使用局部敏感哈希(LSH)高效估计原始空间中的最近邻,从而实现快速的拒绝概率计算。
  • 通过确保最终采样分布紧密模拟真实 D² 分布,该方法保持了与 k-means++ 相同的 O(log k) 近似保证。
  • 该方法在相同的近线性时间预算内,可为所有 k=1,2,…,n 计算出有效的 k-means++ 初始化种子。

实验结果

研究问题

  • RQ1我们能否在保持 O(log k) 近似保证的前提下,实现近线性时间的 k-means++ 初始化?
  • RQ2多树嵌入结合拒绝采样能否产生在分布和质量上与 k-means++ 无法区分的解?
  • RQ3该方法能否突破先前快速 k-means++ 算法在 k 较大时的 Ω(k²) 运行时间瓶颈?
  • RQ4基于 LSH 的最近邻估计能否有效支持快速拒绝采样而不降低解的质量?
  • RQ5在大 k 情况下,该方法在速度和聚类代价方面与 k-means++ 和 Afkmc2 相比如何?

主要发现

  • 所提算法的运行时间为 Õ(nd + (n log Δ)^{1+ε}),实现了近线性复杂度,同时保持了 O(log k) 的近似保证。
  • 在 k=1000 时,该方法在 Song 和 KDD-Cup 等真实数据集上相比 k-means++ 和 Afkmc2 最快可实现一个数量级的速度提升。
  • 在 Song 数据集上,RejectionSampling 在 k=1000 时的聚类代价为 74,654(缩放后乘以 10⁵),与 k-means++(26,784)相当,优于 Afkmc2(82,700)。
  • 在 KDD-Cup 数据集上,该方法在多次运行中保持了低方差,RejectionSampling 在 k=1000 时的聚类代价为 799(缩放后乘以 10²),接近 k-means++(269),显著优于 Afkmc2(883)。
  • 拒绝采样迭代的期望次数被限制在 O(c²d²k) 以内,且每次迭代的时间主要由 LSH 操作主导,从而保证了整体效率。
  • 该方法在相同的运行时间预算内,可为所有 k=1,2,…,n 生成有效的 k-means++ 初始化种子,支持高效的多 k 分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。