Skip to main content
QUICK REVIEW

[論文レビュー] On Euclidean $k$-Means Clustering with $\alpha$-Center Proximity

Amit Deshpande, Anand Louis|arXiv (Cornell University)|Apr 28, 2018
Facility Location and Emergency Management被引用数 3
ひとこと要約

この論文は、各点が自身のクラスタ中心よりも他の中心よりも因数 $\alpha > 1$ だけ近いという $\alpha$-center proximity の制約の下でのユークリッド $k$-means クラスタリングを研究している。$k$ および $1/(α-1)$ に対して指数的でありながら、データサイズおよび次元に対して線形な時間で動作する固定パrameter tractable(FPT)アルゴリズムを提示している。また、任意の $\varepsilon_0 > 0$ に対して $1+\varepsilon_0$ 要因以内での近似が NP 困難であることを証明している。これは $\alpha$-center proximity の下でも成り立つ。

ABSTRACT

$k$-means clustering is NP-hard in the worst case but previous work has shown efficient algorithms assuming the optimal $k$-means clusters are \\emph{stable} under additive or multiplicative perturbation of data. This has two caveats. First, we do not know how to efficiently verify this property of optimal solutions that are NP-hard to compute in the first place. Second, the stability assumptions required for polynomial time $k$-means algorithms are often unreasonable when compared to the ground-truth clusters in real-world data. A consequence of multiplicative perturbation resilience is \\emph{center proximity}, that is, every point is closer to the center of its own cluster than the center of any other cluster, by some multiplicative factor $\\alpha > 1$. We study the problem of minimizing the Euclidean $k$-means objective only over clusterings that satisfy $\\alpha$-center proximity. We give a simple algorithm to find the optimal $\\alpha$-center-proximal $k$-means clustering in running time exponential in $k$ and $1/(\\alpha - 1)$ but linear in the number of points and the dimension. We define an analogous $\\alpha$-center proximity condition for outliers, and give similar algorithmic guarantees for $k$-means with outliers and $\\alpha$-center proximity. On the hardness side we show that for any $\\alpha' > 1$, there exists an $\\alpha \\leq \\alpha'$, $(\\alpha >1)$, and an $\\varepsilon_0 > 0$ such that minimizing the $k$-means objective over clusterings that satisfy $\\alpha$-center proximity is NP-hard to approximate within a multiplicative $(1+\\varepsilon_0)$ factor.

研究の動機と目的

  • 理論的非効率性と実用的効率性のギャップを埋めるために、現実的で構造的な仮定である $\alpha$-center proximity に注目すること。
  • 実世界のデータで観察される自然な安定性条件である $\alpha$-center proximity を満たすクラスタリングに制限した $k$-means 目的関数の最小化に向けた効率的アルゴリズムを設計すること。
  • 外れ値を含むクラスタリングに拡張するため、外れ値処理に類似した $\alpha$-center proximity 条件を導入すること。
  • 構造的制約があるにもかかわらず、$1+\varepsilon_0$ よりも良い定数要因で $\alpha$-center proximal $k$-means を近似することは、本質的に計算的に困難であることを確立すること。

提案手法

  • 新しい問題定式化を提案:$\alpha$-center proximity を満たすクラスタリングに制限して $k$-means 目的関数を最小化すること。$\alpha > 1$ であり、すべての $x \in C_i$ に対して $i \neq j$ のとき $\text{dist}(x, \mu_j) > \alpha \cdot \text{dist}(x, \mu_i)$ が成り立つ。
  • 動的計画法に基づくアルゴリズムを設計し、時間計算量が $2^{O(k + 1/(\alpha-1))} \cdot \text{poly}(n,d)$ となる。これは $k$ および $1/(α-1)$ に対して指数的だが、点数 $n$ および次元 $d$ に対して線形である。
  • 外れ値を含むクラスタリングのための類似した $\alpha$-center proximity 条件を導入し、インライアーとアウーライヤーの中心への距離の乗法的ギャップを保証する。
  • 頂点被覆問題への還元を用いて、$\alpha$-center proximal $k$-means 問題を $1+\varepsilon_0$ 要因以内で近似することは、ある $\varepsilon_0 > 0$ に対して NP 困難であることを証明する。これは $\alpha$ が任意の $\alpha' > 1$ よりも小さい場合でも成り立つ。
  • 各 $k$ および $\alpha$ に対して、$\Omega(2^{\tilde{\Omega}(k/(\alpha^2-1))})$ 個の異なる $\alpha$-center proximal クラスタリングを持つインスタンスの族を構築し、$k$ および $1/(α-1)$ に対する指数的依存性が最悪ケースで必要であることを示す。

実験結果

リサーチクエスチョン

  • RQ1一般問題が NP 困難であるにもかかわらず、$\alpha$-center proximity 制約下での $k$-means クラスタリングに効率的アルゴリズムを設計できるか?
  • RQ2$\alpha$-center proximity 条件が $k$-means の固定パrameter tractable(FPT)アルゴリズムを可能にするのに十分か? その依存関係は $k$ および $\alpha$ にどのように現れるか?
  • RQ3$\alpha$-center proximity 条件は外れ値を含むクラスタリングに拡張可能か? また、その場合、アルゴリズム的 tractability は保たれるか?
  • RQ4構造的制約があるにもかかわらず、任意の $\varepsilon_0 > 0$ に対して $1+\varepsilon_0$ よりも良い定数要因で $\alpha$-center proximal $k$-means を近似できるか?
  • RQ5与えられた $k$ および $\alpha$ に対して、異なる $\alpha$-center proximal クラスタリングの最大数はいくつか?

主な発見

  • 本論文は、$k$ および $1/(α-1)$ に対して指数的でありながら $n$ および $d$ に対して線形な時間で動作する、$\alpha$-center proximal $k$-means クラスタリングの固定パrameter tractable(FPT)アルゴリズムを提示している。計算時間は $2^{O(k + 1/(α-1))} \cdot \text{poly}(n,d)$ である。
  • 任意の $\alpha' > 1$ に対して、ある $\alpha \leq \alpha'$ が存在し、$\alpha$-center proximal クラスタリングに制限した $k$-means 目的関数の最小化が、ある $\varepsilon_0 > 0$ に対して $1+\varepsilon_0$ 要因以内で近似可能でないことが証明されている。
  • 与えられた $k$ および $\alpha$ に対して、異なる $\alpha$-center proximal クラスタリングの数は $2^{\tilde{\Omega}(k/(α^2-1))}$ 個以上である。これは、$k$ および $1/(α-1)$ に対する指数的依存性が最悪ケースで必要であることを示している。
  • 外れ値用の類似した $\alpha$-center proximity 条件を定義し、同じアルゴリズム的保証を、この条件下での $k$-means と外れ値の組み合わせに拡張した。
  • クラスタサイズが $\omega n/k$ で下限付けられている場合($\omega > 0$)でも、その難易度結果は成り立つ。これは、制約が近似の意味で問題を tractable にしないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。