Skip to main content
QUICK REVIEW

[論文レビュー] Achieving Approximate Soft Clustering in Data Streams

Vaneet Aggarwal, Shankar Krishnan|arXiv (Cornell University)|Jul 26, 2012
Advanced Clustering Algorithms Research参考文献 21被引用数 5
ひとこと要約

本稿では、データストリームにおける近似ソフトクラスタリングのためのワンパスストリーミングアルゴリズムを提示する。k-means++フレームワークをストリーミングおよびスライディングウィンドウモデルに拡張し、限られたメモリ環境下で動的データを扱う際に、ソフトk-meansに対してO(log k)-競合比近似を達成する。

ABSTRACT

In recent years, data streaming has gained prominence due to advances in technologies that enable many applications to generate continuous flows of data. This increases the need to develop algorithms that are able to efficiently process data streams. Additionally, real-time requirements and evolving nature of data streams make stream mining problems, including clustering, challenging research problems. In this paper, we propose a one-pass streaming soft clustering (membership of a point in a cluster is described by a distribution) algorithm which approximates the "soft" version of the k-means objective function. Soft clustering has applications in various aspects of databases and machine learning including density estimation and learning mixture models. We first achieve a simple pseudo-approximation in terms of the "hard" k-means algorithm, where the algorithm is allowed to output more than $k$ centers. We convert this batch algorithm to a streaming one (using an extension of the k-means++ algorithm recently proposed) in the "cash register" model. We also extend this algorithm when the clustering is done over a moving window in the data stream.

研究の動機と目的

  • 高容量かつリアルタイムなデータストリームにおける効率的でワンパスのストリーミングソフトクラスタリングアルゴリズムの設計。
  • k-means++アルゴリズムをストリーミングおよびモービングウィンドウモデルに拡張し、クラスタリング品質の向上。
  • ハードk-means問題との関連を用いて、ソフトk-meansに対する理論的近似保証の確立。
  • 動的データの挿入・削除を伴うスライディングウィンドウ上でのメモリ効率の良いソフトクラスタリングの解決策の提供。
  • k-means++初期化と標準EMとの比較において、収束速度および目的関数値の優位性を実験的に検証。

提案手法

  • ハードk-means問題の擬似近似を用い、k個より多くの中心点を許容することで、有界な近似要因を達成する。
  • コアセット構築を伴う多段階クラスタリング階層を用いて、k-means++アルゴリズムをストリーミング「キャッシュレジスタ」モデルに適応する。
  • スライディングウィンドウサイズLを維持し、重み付き平均を用いてクラスタ中心点を動的に更新することで、モービングウィンドウモデルにアルゴリズムを拡張する。
  • 各レベルがM個のポイントを処理し、3k log k個の中心点に縮小するt段階の階層的クラスタリング構造を採用し、効率的なウィンドウシフトを可能にする。
  • 競合分析フレームワークを用いて、スライディングウィンドウモデルにおけるk-meansのO(log k)-競合性を示す。
  • 目的関数の構造を保つ変換を用いて、k-meansの近似保証をソフトk-meansに転送する。

実験結果

リサーチクエスチョン

  • RQ1高次元で連続的なデータストリームの下で、ストリーミングアルゴリズムがソフトk-meansに対して定数因子近似を達成できるか?
  • RQ2k-means++初期化をストリーミングおよびスライディングウィンドウモデルに適応することで、限られたメモリ環境下でも近似品質を維持できるか?
  • RQ3モービングウィンドウ上でのストリーミングソフトクラスタリングアルゴリズムの理論的競合比は何か?
  • RQ4収束速度および目的関数値の観点から、k-means++ベースの初期化と標準EMの性能はどのように比較されるか?
  • RQ5動的データの挿入・削除を伴うスライディングウィンドウ上でも、コアセットベースのアプローチで近似中心点を維持できるか?

主な発見

  • 提案アルゴリズムは、メモリ複雑度O(L^ε(k log k)^{1−ε})(ε = 1/(t+1))を満たすスライディングウィンドウモデルにおいて、k-meansに対してO(log k)-競合比近似を達成する。
  • ソフトk-meーンズの目的関数は、k-meansの近似保証から導かれるO(k^m(1−m) log k)の競合比で近似される。
  • 実験結果から、k-means++初期化により、Spamデータセット(n=4601, d=58)において目的関数値が最大89.91%削減され、実行時間が最大83%短縮された。
  • Cloudデータセット(n=1024, d=10)では、EM++が実行時間で最大83%の改善、ポテンシャル関数値で33.85%の削減を達成した。
  • t段階目の最も古い3k log k個のポイントを、直前の段階からの新しい中心点に動的に置き換えることで、ウィンドウがスライドしてもO(log k)-競合性を維持する。
  • 本手法はキャッシュレジスタモデルおよびモービングウィンドウモデルの両方をサポートし、制限されたメモリと近似誤差を伴うリアルタイムソフトクラスタリングを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。