Skip to main content
QUICK REVIEW

[論文レビュー] Explainable $k$-Means and $k$-Medians Clustering

Sanjoy Dasgupta, Nave Frost|arXiv (Cornell University)|Feb 28, 2020
Rough Sets and Fuzzy Logic参考文献 51被引用数 20
ひとこと要約

本稿では、$k$-meansおよび$k$-mediansクラスタリングを、証明可能な近似保証を持つ小さな意思決定木(しきい値木)を用いて解釈可能にすることを提案する。IMMアルゴリズムを提示し、$k$-メディアンに対して$O(k)$、$k$-meansに対して$O(k^2)$の近似比を達成するとともに、$ heta("log k$)の下界を証明し、解釈可能な非教師あり学習に対する理論的保証の初の例を確立する。

ABSTRACT

Clustering is a popular form of unsupervised learning for geometric data. Unfortunately, many clustering algorithms lead to cluster assignments that are hard to explain, partially because they depend on all the features of the data in a complicated way. To improve interpretability, we consider using a small decision tree to partition a data set into clusters, so that clusters can be characterized in a straightforward manner. We study this problem from a theoretical viewpoint, measuring cluster quality by the $k$-means and $k$-medians objectives: Must there exist a tree-induced clustering whose cost is comparable to that of the best unconstrained clustering, and if so, how can it be found? In terms of negative results, we show, first, that popular top-down decision tree algorithms may lead to clusterings with arbitrarily large cost, and second, that any tree-induced clustering must in general incur an $Ω(\log k)$ approximation factor compared to the optimal clustering. On the positive side, we design an efficient algorithm that produces explainable clusters using a tree with $k$ leaves. For two means/medians, we show that a single threshold cut suffices to achieve a constant factor approximation, and we give nearly-matching lower bounds. For general $k \geq 2$, our algorithm is an $O(k)$ approximation to the optimal $k$-medians and an $O(k^2)$ approximation to the optimal $k$-means. Prior to our work, no algorithms were known with provable guarantees independent of dimension and input size.

研究の動機と目的

  • 小さな意思決定木を用いてクラスタを定義することで、正確かつ解釈可能なクラスタリング手法を開発すること。
  • 特に$k$-meansおよび$k$-mediansに対して、解釈可能クラスタリングにおける理論的保証の欠如に取り組むこと。
  • 解釈可能性(木構造によるもの)とクラスタリングの質(標準的目的関数で測定)のトレードオフを分析すること。
  • 木によって誘導されるクラスタリングの近似品質に関する、証明可能な上界および下界を確立すること。

提案手法

  • $k$個のリーフを持つしきい値木を用いてデータを分割し、各リーフが1つのクラスタに対応し、個々の特徴に対する軸に沿ったカットに基づく意思決定を行う。
  • $k$-メディアンおよび$k$-meansコストを最小化するように再帰的に木を構築するためのIMM(反復的最適マージ)アルゴリズムを設計する。
  • 幾何学的および確率的議論を用いて、木によって誘導されるクラスタリングのコストが最適クラスタリングに対する相対的コストを評価する。
  • 木の深さに基づく解析を用い、木構造と近似係数の関係を明らかにし、コストが木の深さに応じて増加することを示す。
  • 内部ノードからの寄与を分解する新しい手法を用い、データポイントとクラスタ中心の相関を活用する。
  • ランダムハイパーキューブの中心と擬似ランダム射影を用いて下界を証明し、一般のデータセットに対して$ heta(\log k)$が避けられないことを示す。

実験結果

リサーチクエスチョン

  • RQ1$k$個のリーフを持つしきい値木は、最適な制約なしクラスタリングの$k$-メディアンまたは$k$-meansコストを定数因子内に収めるクラスタリングを生成できるか?
  • RQ2$k$-メディアンおよび$k$-meansに対して、任意の木誘導クラスタリングが達成可能な最良の近似因子は何か?
  • RQ3トップダウン型意思決定木アルゴリズム(例:ID3 や CART)は良い解釈可能なクラスタリングを生成できるか、それとも著しく失敗する可能性があるか?
  • RQ4近似誤差が有界であるような、木誘導クラスタリングを構築する証明可能な効率的アルゴリズムは存在するか?
  • RQ5近似因子はデータ次元に依存するのか、それとも入力サイズや次元に依存せずに一定のままであるのか?

主な発見

  • IMMアルゴリズムは、$k$-メディアンに対して$O(k)$、$k$-meansに対して$O(k^2)$の近似を達成する。これらの上限は木の深さとデータ構造に依存する。
  • $k=2$の場合、1つのしきい値カットで定数因子の近似が達成可能であり、この境界はほぼタイトである。
  • 任意の木誘導クラスタリングは、最適クラスタリングと比較して、少なくとも$ Omega(\log k)$の近似因子を有する必要がある。これは最良の場合でも避けられない。
  • この下界はタイトであり、直径$O(1)$で中心間隔$ Omega(d)$の$k$個の明確に分離されたクラスタを持つデータセットが、擬似ランダム射影によって構築可能であることに起因する。
  • 近似因子はデータ次元や入力サイズに依存せず、さまざまな設定においても堅牢な保証を提供する。
  • トップダウン型意思決定木アルゴリズムは、最適解に対するコストが任意に大きくなるクラスタリングを生成する可能性があるため、IMMのような特別なアルゴリズムの必要性が浮き彫りになる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。