Skip to main content
QUICK REVIEW

[論文レビュー] An Algorithm for Online K-Means Clustering

Edo Liberty, Ram Sriharsha|arXiv (Cornell University)|Dec 18, 2014
Optimization and Search Problems参考文献 12被引用数 5
ひとこと要約

本稿では、入力データ点をリアルタイムにクラスタに割り当てるオンラインk-meansクラスタリングアルゴリズムを提示する。このアルゴリズムは、最適k-meansコストと比較して競合的近似比を維持する。生成されるクラスタ数は Õ(k) であり、目的関数値は Õ(W*) である。W* は最適k-meansコストを表す。実験的に、データストリームの事前知識がなく、より厳しいオンライン制約下に置かれたにもかかわらず、k-means++とほぼ同等の性能を発揮する。

ABSTRACT

This paper shows that one can be competitive with the k-means objective while operating online. In this model, the algorithm receives vectors v_1,...,v_n one by one in an arbitrary order. For each vector the algorithm outputs a cluster identifier before receiving the next one. Our online algorithm generates ~O(k) clusters whose k-means cost is ~O(W*). Here, W* is the optimal k-means cost using k clusters and ~O suppresses poly-logarithmic factors. We also show that, experimentally, it is not much worse than k-means++ while operating in a strictly more constrained computational model.

研究の動機と目的

  • データ点を過去の点を再訪問せずに逐次的にクラスタラベルに割り当てるオンラインk-meansクラスタリングアルゴリズムを設計すること。
  • 各点あたり多項式対数時間・空間で動作する制約のもと、最適k-meansコストW*と競合的近似比を達成すること。
  • k-means++(複数回の走査を要するオフライン手法)に匹敵する性能を示すこと。これは、より制限の厳しいオンラインモデルで動作するにもかかわらず、である。
  • アルゴリズムがデータストリームや最適コストについて事前の知識を持たない状況下でも、生成されるクラスタ数がkに近いことを示すこと。

提案手法

  • アルゴリズムは任意の順序でデータ点を1つずつ処理し、確率的基準に基づいて既存のクラスタに割り当てるか、新しいクラスタを開設する。
  • 最適コストW*の下界w*とストリーム長nの推定値を仮定する半オンラインバージョンを採用し、クラスタ数を制御する。
  • アルゴリズムは、期待されるクラスタ数がO(k log n log(W*/w*))であり、期待される目的関数コストがO(W*)であることを保証する。
  • 完全なオンライン設定(W* や n についての事前知識なし)では、近似要因がlog n要因で悪化するように変更された戦略を採用する。
  • クラスタ品質とクラスタ数のバランスを取るセンター選択メカニズムを採用し、割り当てられた中心点への二乗距離の和を最小化する。
  • 理論的分析により、データの順序が敵対的であっても、最適解と競合的であることが証明される。

実験結果

リサーチクエスチョン

  • RQ1オンラインk-meansアルゴリズムは、最適k-meansコストW*に対して定数または多項式対数近似比を達成できるか?
  • RQ2期待されるクラスタ数はどの程度で、これはターゲットkやデータ特性とどのように関係するか?
  • RQ3k-means++(オフラインで複数回走査する)に比べて、オンラインアルゴリズムのクラスタリングコストはどの程度か?
  • RQ4W* や n についての事前知識が全くない場合、アルゴリズムの性能はどの程度劣化するか?
  • RQ5実際のクラスタ数とターゲットクラスタ数の比は、異なるデータセットやkの値に対して安定しているか?

主な発見

  • 半オンライン設定では、期待されるクラスタ数がO(k log n log(W*/w*))であり、期待される目的関数コストがO(W*)に達する。
  • 完全なオンライン設定では、クラスタ数は半オンラインバージョンと同等の水準であるが、近似要因がlog n要因で悪化する。
  • 実験的に、実際のクラスタ数とターゲットクラスタ数の比(k_actual / k_target)は、異なるデータセットやk値においてほぼ一定で、1に近い。
  • オンラインアルゴリズムのコストf_onlineは、k_targetが増加するにつれて単調に減少し、より多くのクラスタが許可されるにつれて一貫した改善が見られる。
  • 各データセットについて、k_targetの値に関わらず、f_online / f_randomの比はほぼ一定であり、オンラインクラスタリングがランダム中心選択と同程度の速度で改善していることを示している。
  • k-means++と比較して、オンラインアルゴリズムはほとんどのデータセットでわずかに定数倍の劣化にとどまり、ランダムクラスタリングよりも著しく優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。