[论文解读] ExKMC: Expanding Explainable $k$-Means Clustering
ExKMC 是一种新颖的算法,通过允许在可解释性与准确性之间进行灵活权衡,扩展了可解释的 $k$-means 聚类方法。该方法使用具有 $k'$ 个叶节点的决策树,其中 $k' \geq k$,利用代理代价函数高效地扩展树结构并分配聚类,从而在保持可解释的、基于特征的解释的同时,实现了低于先前方法的聚类代价。
Despite the popularity of explainable AI, there is limited work on effective methods for unsupervised learning. We study algorithms for $k$-means clustering, focusing on a trade-off between explainability and accuracy. Following prior work, we use a small decision tree to partition a dataset into $k$ clusters. This enables us to explain each cluster assignment by a short sequence of single-feature thresholds. While larger trees produce more accurate clusterings, they also require more complex explanations. To allow flexibility, we develop a new explainable $k$-means clustering algorithm, ExKMC, that takes an additional parameter $k' \geq k$ and outputs a decision tree with $k'$ leaves. We use a new surrogate cost to efficiently expand the tree and to label the leaves with one of $k$ clusters. We prove that as $k'$ increases, the surrogate cost is non-increasing, and hence, we trade explainability for accuracy. Empirically, we validate that ExKMC produces a low cost clustering, outperforming both standard decision tree methods and other algorithms for explainable clustering. Implementation of ExKMC available at https://github.com/navefr/ExKMC.
研究动机与目标
- 解决可解释无监督学习方法(尤其是聚类方法)缺乏有效性的不足。
- 克服先前可解释 $k$-means 算法将决策树严格限制为恰好 $k$ 个叶节点的局限性。
- 通过允许 $k' \geq k$ 个叶节点,实现聚类准确率与解释复杂度之间的可调权衡。
- 开发一种高效且可扩展的算法,在保持低聚类代价的同时生成人类可理解的聚类分配结果。
- 通过实证证明,将树的大小扩展至超过 $k$ 个叶节点可实现代价的单调降低,并接近最优聚类性能。
提出的方法
- 从迭代误分类最小化(IMM)算法开始,生成一个具有 $k$ 个叶节点的初始决策树,并分配 $k$ 个聚类。
- 基于标准 $k$-means 的固定 $k$ 个参考中心,引入一个代理代价函数,以实现树结构的高效扩展。
- 通过在每一步贪心地添加新的特征-阈值分裂来扩展树结构,以最小化代理代价。
- 根据与最近参考中心的距离,将每个叶节点分配给 $k$ 个聚类之一,允许多个叶节点映射到同一聚类。
- 确保随着 $k'$ 增加,代理代价非递增,从而保证聚类质量的单调提升。
- 采用基于特征的并行化技术以优化性能,尤其适用于高维和稀疏数据集。
实验结果
研究问题
- RQ1通过将决策树扩展至超过 $k$ 个叶节点,我们能否实现低于现有可解释聚类方法的 $k$-means 聚类代价?
- RQ2增加阈值树中的叶节点数量是否会导致聚类代价单调下降,同时保持可解释性?
- RQ3在树扩展过程中,代理代价在多大程度上能近似真实 $k$-means 代价?
- RQ4基于树的聚类在真实世界的高维数据集上,能在多大程度上匹配标准 $k$-means 的代价?
- RQ5在真实应用场景中,解释复杂度(叶节点数量)与聚类准确率之间的实际权衡如何?
主要发现
- ExKMC 在所有测试数据集上均持续实现了低于标准 $k$-means 和先前可解释聚类方法(包括 IMM)的 $k$-means 聚类代价。
- 当 $k' = 4k$ 时,ExKMC 在大多数真实数据集上达到了与参考 $k$-means 聚类相当的代价,表现出接近最优的性能。
- 代理代价与实际 $k$-means 代价高度吻合,各数据集之间的差异不超过 5%–10%,且在三个数据集上随 $k'$ 增加而实现收敛。
- ExKMC 在所有测试数据集上的运行时间均低于 15 分钟,即使在 20newsgroups 等高维数据上,其开销也仅为标准 $k$-means 的 0.25× 至 1.5×。
- 随着 $k'$ 增加,代价单调下降,验证了代理代价非递增的理论性质。
- 在 CIFAR-10 上,使用原始像素特征时,所有方法均未收敛,但 ExKMC 在 $4k$ 个叶节点下仍表现出强劲性能,表明其在复杂数据上的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。