Skip to main content
QUICK REVIEW

[论文解读] Near-optimal Algorithms for Explainable k-Medians and k-Means

Konstantin Makarychev, Liren Shan|arXiv (Cornell University)|Jul 2, 2021
Auction Theory and Applications被引用 8
一句话总结

本论文提出了一组近似最优的可解释 $k$-medians 和 $k$-means 聚类算法,采用阈值决策树实现,针对 $\ell_1$-范数 $k$-medians 的竞争比达到 $\tilde{O}(\log k)$,针对 $k$-means 的竞争比达到 $\tilde{O}(k)$,优于以往的 $O(k)$ 和 $O(k^2)$ 边界。此外,还提出了一种 $O(\log^{3/2}k)$-竞争比的算法用于 $\ell_2$-范数 $k$-medians,并通过匹配的下界证明了该算法的近似最优性。

ABSTRACT

We consider the problem of explainable $k$-medians and $k$-means introduced by Dasgupta, Frost, Moshkovitz, and Rashtchian~(ICML 2020). In this problem, our goal is to find a threshold decision tree that partitions data into $k$ clusters and minimizes the $k$-medians or $k$-means objective. The obtained clustering is easy to interpret because every decision node of a threshold tree splits data based on a single feature into two groups. We propose a new algorithm for this problem which is $ ilde O(\log k)$ competitive with $k$-medians with $\ell_1$ norm and $ ilde O(k)$ competitive with $k$-means. This is an improvement over the previous guarantees of $O(k)$ and $O(k^2)$ by Dasgupta et al (2020). We also provide a new algorithm which is $O(\log^{3/2} k)$ competitive for $k$-medians with $\ell_2$ norm. Our first algorithm is near-optimal: Dasgupta et al (2020) showed a lower bound of $Ω(\log k)$ for $k$-medians; in this work, we prove a lower bound of $ ildeΩ(k)$ for $k$-means. We also provide a lower bound of $Ω(\log k)$ for $k$-medians with $\ell_2$ norm.

研究动机与目标

  • 设计高效且可解释的聚类算法,利用阈值决策树在保持强近似保证的前提下实现性能优化。
  • 改进以往针对可解释 $k$-medians($\ell_1$)和 $k$-means 的 $O(k)$ 和 $O(k^2)$ 竞争比边界。
  • 为 $k$-medians($\ell_2$)和 $k$-means 建立紧致的可解释性代价下界,证明所提算法的近似最优性。
  • 设计一种快速变体算法,通过红黑树高效管理中心点,实现 $O(kd\log^2k)$ 的运行时间。

提出的方法

  • 提出一种新颖的阈值树构建算法,通过基于中心点间特征差异的随机切割递归划分聚类。
  • 使用红黑树维护每个叶节点的中心点集合,实现高效的中心点更新与采样,确保每个节点的切割与划分操作在 $O(d\log k)$ 时间内完成。
  • 针对每个叶节点 $u$,从分离切割集合 $R^u$ 中随机选择阈值,确保中心点被有效分离的同时最小化代价。
  • 采用递归分割策略,优先处理较小的子分区,以降低数据结构中删除与插入操作的开销。
  • 结合几何与组合论证,限制受损中心点的数量,并推导出代价的下界。
  • 基于早期树层中中心点分布的双情形分析,证明任意阈值树的代价下界。

实验结果

研究问题

  • RQ1我们能否设计一种可解释的 $k$-medians 算法,使其在 $\ell_1$ 范数下的竞争比优于 $O(k)$?
  • RQ2可解释 $k$-means 的最优竞争比是多少?能否将其改进至 $O(k^2)$ 以下?
  • RQ3是否存在一种针对 $\ell_2$ 范数可解释 $k$-medians 的近似最优算法?该场景下的可解释性代价是多少?
  • RQ4针对 $k$-medians($\ell_2$)和 $k$-means 的可解释性代价是否存在紧致下界?它们与上界相比如何?

主要发现

  • 所提算法在 $\ell_1$-范数 $k$-medians 上实现了 $\tilde{O}(\log k)$ 的竞争比,优于以往的 $O(k)$ 边界。
  • 对于 $k$-means,算法实现了 $\tilde{O}(k)$ 的竞争比,优于先前的 $O(k^2)$ 保证。
  • 新提出的算法在 $\ell_2$-范数 $k$-medians 上实现了 $O(\log^{3/2}k)$ 的竞争比,与已知的 $\Omega(\log k)$ 下界在对数因子内匹配。
  • 论文证明了 $k$-means 的下界为 $\tilde{\Omega}(k)$,表明 $\tilde{O}(k)$ 的竞争比已近乎最优。
  • 针对 $\ell_2$-范数 $k$-medians,建立了 $\Omega(\log k)$ 的下界,与新算法的竞争比在对数因子内匹配。
  • 通过在 $d$ 个红黑树中维护中心点并高效管理分区更新,算法的快速变体运行时间达到 $O(kd\log^2k)$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。