Skip to main content
QUICK REVIEW

[論文レビュー] A balanced k-means algorithm for weighted point sets

Steffen Borgwardt, Andreas Brieden|arXiv (Cornell University)|Aug 19, 2013
Data Management and Algorithms参考文献 33被引用数 4
ひとこと要約

本稿では、クラスタサイズに所定の下限および上限を課す重み付き点集合を扱えるように古典的k-meansを拡張する重みバランス型k-meansアルゴリズムを提案する。割り当てフェーズを重みバランス型分割ポリトープ上の線形計画問題としてモデル化し、多面体理論を活用することで、$(40ek^2n)^{(d+1)k-1}$回以内の反復で有限収束を保証し、固定された$k$および$d$に対して多項式時間で終了することを証明する。本手法は部分的所属クラスタリングをサポートし、非線形データのカーネル化を可能にする。

ABSTRACT

The classical $k$-means algorithm for partitioning $n$ points in $\mathbb{R}^d$ into $k$ clusters is one of the most popular and widely spread clustering methods. The need to respect prescribed lower bounds on the cluster sizes has been observed in many scientific and business applications. In this paper, we present and analyze a generalization of $k$-means that is capable of handling weighted point sets and prescribed lower and upper bounds on the cluster sizes. We call it weight-balanced $k$-means. The key difference to existing models lies in the ability to handle the combination of weighted point sets with prescribed bounds on the cluster sizes. This imposes the need to perform partial membership clustering, and leads to significant differences. For example, while finite termination of all $k$-means variants for unweighted point sets is a simple consequence of the existence of only finitely many partitions of a given set of points, the situation is more involved for weighted point sets, as there are infinitely many partial membership clusterings. Using polyhedral theory, we show that the number of iterations of weight-balanced $k$-means is bounded above by $n^{O(dk)}$, so in particular it is polynomial for fixed $k$ and $d$. This is similar to the known worst-case upper bound for classical $k$-means for unweighted point sets and unrestricted cluster sizes, despite the much more general framework. We conclude with the discussion of some additional favorable properties of our method.

研究の動機と目的

  • 実世界の応用、特にデータ分析、リスク予測、農地集積においてクラスタサイズが制限される必要がある状況に対応する。
  • 点に個々の重み(重複または価値のあるデータポイント)が付与された重み付き点集合を扱えるように、古典的k-meansを拡張する。
  • クラスタサイズの下限および上限を組み込むことで、空のクラスタを回避し、バランスの取れた分割を強制することで、有限かつ有界な収束を保証する。
  • 線形計画法を用いて、実行可能でサイズ制約付きのクラスタリングを可能にする一般化されたパワー図(一般化されたボロノイ図)への一般化を実現するフレームワークを開発する。
  • 重み付き設定における部分的所属クラスタリングの無限集合が存在するにもかかわらず、アルゴリズムの理論的収束保証を確立する。

提案手法

  • 重みバランス型最小二乗割り当てを、重みバランス型分割ポリトープ上の線形計画問題としてモデル化し、サイズ制約を満たす実行可能クラスタリングを表現する。
  • 制約を用いて実行可能領域を定義する:(1) クラスタ重み制約 $\kappa_i^- \leq \sum_j \omega_j y_{ij} \leq \kappa_i^+$、(2) 全割り当て制約 $\sum_i y_{ij} = 1$、(3) 非負性制約 $y_{ij} \geq 0$。
  • 頂点ベースの改善:解$y^*$がポリトープの頂点である場合、整数割り当て($y_{ij} \in \{0,1\}$)を固定して新たな実行可能領域$Q(y^*)$を定義し、縮小された線形計画問題を再解く。
  • 多面体理論を用いて、制限されたポリトープ$Q(y^*)$の頂点数を評価する。これは、高々$2(k-1)$個の分数変数があることから、$\binom{5k-2}{2(k-1)} \leq (5k)^{2k-2}$未満である。
  • 強可行なパワー図の数($\left(\frac{8e(k-1)n}{d}\right)^{(d+1)k-1}$未満)を用いて、全異なるクラスタ割り当ての数を上界で評価する。
  • 内積$x_j^T s_i$をカーネル関数$\Phi(x_j, s_i)$に置き換えることでカーネル化を可能にし、アルゴリズムの構造を変更せずに非線形クラスタリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1古典的k-meansアルゴリズムは、クラスタサイズに所定の下限および上限を課す重み付き点集合を扱えるようにどのように一般化できるか?
  • RQ2重み制約により部分的所属クラスタリングが必要となる状況において、このような一般化k-meansアルゴリズムの理論的収束挙動はいかなるものか?
  • RQ3重み付き設定における部分的所属クラスタリングの非可算無限集合が存在するにもかかわらず、有限収束を保証できるか?
  • RQ4収束に要する最大反復回数は何か? また、$n$、$k$、$d$に関して多項式的に上界を示せるか?
  • RQ5カーネル法を用いて、非線形データに効率的に拡張・実装するにはどうすればよいか?

主な発見

  • 重みバランス型k-meansアルゴリズムは、$(40ek^2n)^{(d+1)k-1}$回以内の反復で有限収束を保証し、固定された$k$および$d$に対して$n$に関して多項式的である。
  • 異なる強可行なパワー図の数(正当なクラスタ構成に対応)は、$\left(\frac{8e(k-1)n}{d}\right)^{(d+1)k-1}$未満で抑えられ、一意なクラスタ割り当ての数に対する理論的上界を提供する。
  • 整数割り当てを固定した後、制限された実行可能領域$Q(y^*)$の頂点数は、$(5k)^{2k-2}$未満であるため、アルゴリズム実行中に同じ頂点が再訪問されることはない。
  • アルゴリズムはウォームスタートをサポートする:反復間で実行可能領域が変化しないため、直前の最適割り当て$y^*$は依然として実行可能であり、初期点として再利用可能である。
  • 本手法は自然にカーネル化可能である。標準的な内積をカーネル関数$\Phi(x_j, s_i)$に置き換えることで、アルゴリズムの構造を変更せずに非線形クラスタリングを実現できる。
  • 本フレームワークは、重みとサイズ制約を組み込むことで、古典的k-meansおよびボロノイ図を一般化し、データマイニング、予測保全、土地集積応用に応用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。