Skip to main content
QUICK REVIEW

[论文解读] An Algorithm for Online K-Means Clustering

Edo Liberty, Ram Sriharsha|arXiv (Cornell University)|Dec 18, 2014
Optimization and Search Problems参考文献 12被引用 5
一句话总结

本文提出了一种在线 k-means 聚类算法,能够实时将每个到达的数据点分配到一个聚类中,同时保持与最优 k-means 费用的竞争力近似比。该算法生成 Õ(k) 个聚类,目标值为 Õ(W*),其中 W* 为最优 k-means 费用。尽管在无数据流先验知识的严格在线约束下运行,其性能在经验上几乎与 k-means++ 相当。

ABSTRACT

This paper shows that one can be competitive with the k-means objective while operating online. In this model, the algorithm receives vectors v_1,...,v_n one by one in an arbitrary order. For each vector the algorithm outputs a cluster identifier before receiving the next one. Our online algorithm generates ~O(k) clusters whose k-means cost is ~O(W*). Here, W* is the optimal k-means cost using k clusters and ~O suppresses poly-logarithmic factors. We also show that, experimentally, it is not much worse than k-means++ while operating in a strictly more constrained computational model.

研究动机与目标

  • 设计一种在线 k-means 聚类算法,按顺序为数据点分配聚类标签,且不重新访问过去的点。
  • 在仅使用对数空间和时间(每点)的前提下,实现与最优 k-means 费用 W* 的竞争力近似比。
  • 证明该算法在严格更受限制的在线模型下运行时,性能几乎与 k-means++(一种需要多轮遍历的离线算法)相当。
  • 证明即使在对数据流或最优费用无任何先验知识的情况下,该算法生成的聚类数量也接近 k。

提出的方法

  • 该算法以任意顺序逐个处理数据点,根据概率准则将其分配到现有聚类或开启新聚类。
  • 采用半在线变体,假设已知最优费用 W* 的下界 w*,以及对数据流长度 n 的估计,以控制聚类数量。
  • 该算法确保聚类的期望数量为 O(k log n log(W*/w*)),且期望目标费用为 O(W*)。
  • 在完全在线设置下(无任何先验知识),采用一种改进策略,使近似因子退化一个 log n 因子。
  • 采用一种中心选择机制,平衡聚类质量与聚类数量,最小化到分配中心的平方距离之和。
  • 理论分析证明,即使在数据顺序为对抗性的情况下,该算法仍与最优解保持竞争力。

实验结果

研究问题

  • RQ1能否设计一种在线 k-means 算法,使其相对于最优 k-means 费用 W* 的近似比为常数或对数多边形?
  • RQ2该算法在期望下生成多少个聚类?这与目标 k 及数据特征有何关系?
  • RQ3尽管 k-means++ 是离线算法且需多轮遍历,该在线算法在聚类费用方面与之相比如何?
  • RQ4当无法获得 W* 或 n 的先验知识时,该算法的性能退化程度如何?
  • RQ5在不同数据集和 k 值下,实际聚类数与目标聚类数的比值是否保持稳定?

主要发现

  • 在半在线设置下,该算法期望生成 O(k log n log(W*/w*)) 个聚类,且期望目标费用为 O(W*)。
  • 在完全在线设置下,该算法生成的聚类数量与半在线版本相近,但近似因子退化了一个 log n 因子。
  • 经验上,实际聚类数与目标聚类数的比值(k_actual / k_target)在不同数据集和 k 值下保持大致恒定且接近 1。
  • 在线算法的费用 f_online 随 k_target 增加而单调递减,表明随着允许更多聚类,性能持续提升。
  • 对于每个数据集,f_online / f_random 在不同 k_target 值下几乎保持恒定,表明在线聚类的改进速率与随机中心选择相当。
  • 与 k-means++ 相比,该在线算法性能几乎相当,大多数数据集仅存在微小的常数因子退化,且显著优于随机聚类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。