Skip to main content
QUICK REVIEW

[論文レビュー] Sensitivity Sampling Over Dynamic Geometric Data Streams with Applications to $k$-Clustering

Zhao Song, Lin F. Yang|arXiv (Cornell University)|Feb 1, 2018
Sparse and Compressive Sensing Techniques参考文献 37被引用数 6
ひとこと要約

本稿は、動的幾何的データストリームにおける感度ベースのサンプリングのための新規データ構造を導入し、$k$-meansおよび関連するクラスタリング問題における1パスcoreset構築を可能にする。空間計算量は$\widetilde{O}(k\mathrm{poly}(d))$を達成し、$k$にほぼ最適な依存関係と次元$d$に多項式的依存関係を持つ、$k$-meansの動的ストリームアルゴリズムとしては初となる。この手法は、$k$-median、$M$-estimatorクラスタリング、一般の距離関数に基づくコスト関数に対しても一様に拡張可能であり、空間計算量に$\mathrm{poly}(d)$のオーバーヘッドしか発生しない。

ABSTRACT

Sensitivity based sampling is crucial for constructing nearly-optimal coreset for $k$-means / median clustering. In this paper, we provide a novel data structure that enables sensitivity sampling over a dynamic data stream, where points from a high dimensional discrete Euclidean space can be either inserted or deleted. Based on this data structure, we provide a one-pass coreset construction for $k$-means %and M-estimator clustering using space $\widetilde{O}(k\mathrm{poly}(d))$ over $d$-dimensional geometric dynamic data streams. While previous best known result is only for $k$-median [Braverman, Frahling, Lang, Sohler, Yang' 17], which cannot be directly generalized to $k$-means to obtain algorithms with space nearly linear in $k$. To the best of our knowledge, our algorithm is the first dynamic geometric data stream algorithm for $k$-means using space polynomial in dimension and nearly optimal in $k$. We further show that our data structure for maintaining coreset can be extended as a unified approach for a more general classes of $k$-clustering, including $k$-median, $M$-estimator clustering, and clusterings with a more general set of cost functions over distances. For all these tasks, the space/time of our algorithm is similar to $k$-means with only $\mathrm{poly}(d)$ factor difference.

研究の動機と目的

  • 低空間計算量を実現する効率的な動的ストリーミングアルゴリズムが$k$-meansクラスタリングに不足しているという問題に対処すること。
  • 点の挿入・削除が可能な動的幾何的データストリームにおいて、感度サンプリング技術を効果的に維持すること。
  • $k$-median、$M$-estimatorクラスタリング、一般の距離に基づくコスト関数に適用可能な統一的なフレームワークを設計すること。
  • $k$にほぼ線形で、次元$d$に多項式的依存関係を持つ空間計算量を達成することにより、従来の$k$-median専用の結果を改善すること。

提案手法

  • 挿入・削除が可能なストリームにおける点の感度スコアを維持する動的データ構造を設計する。
  • このデータ構造を用いて感度に基づく重要度サンプリングを実行し、$k$-クラスタリング目的関数のcoresetの品質を保証する。
  • サンプルされた点を用いて、データストリームを1パスで走査することでcoresetを構築する。
  • 感度計算の適応により、$k$-median、$M$-estimatorクラスタリング、一般のコスト関数への拡張を実現する。
  • すべてのクラスタリングバージョンにおいて、空間計算量と時間計算量が$\widetilde{O}(k\mathrm{poly}(d))$のまま維持されることを保証する。
  • 既存のcoreset理論を活用し、高確率で$(1+\varepsilon)$-近似解が得られることを保証する。

実験結果

リサーチクエスチョン

  • RQ1挿入・削除が可能な動的幾何的データストリームにおいて、感度サンプリングを効率的に維持することは可能か?
  • RQ2$k$にほぼ線形で、次元$d$に多項式的依存関係を持つ空間計算量を実現しつつ、動的ストリームで$k$-meansクラスタリングの1パスcoresetを構築することは可能か?
  • RQ3同じフレームワークを$k$-median、$M$-estimator、その他の距離に基づくクラスタリング目的関数へ一般化することは可能か?
  • RQ4より一般的なコスト関数へのcoreset構築の拡張に伴う空間計算量と時間計算量のオーバーヘッドは何か?
  • RQ5動的更新下で、さまざまなクラスタリング目的関数に対して感度ベースのサンプリング戦略はどのようにスケーリングするか?

主な発見

  • 提案されたデータ構造により、$k$-meansクラスタリングの動的幾何的データストリームにおいて、空間計算量$\widetilde{O}(k\mathrm{poly}(d))$で1パスcoreset構築が可能となった。
  • これは、$k$にほぼ線形で、次元$d$に多項式的依存関係を持つ、$k$-meansの動的ストリームアルゴリズムとしては初となる。これにより、従来の$k$-median専用の結果に起因するギャップが解消された。
  • フレームワークは、$k$-median、$M$-estimatorクラスタリング、その他の距離に基づくコスト関数に対しても一様に拡張可能であり、空間計算量と時間計算量に$\mathrm{poly}(d)$の要因のみの増加で対応できる。
  • すべての検討対象の$k$-クラスタリング目的関数に対して、高確率で$(1+\varepsilon)$-近似解が保証される。
  • 動的更新下でも感度サンプリングの効率が維持され、リアルタイムのクラスタリングワークロードへの実用的導入が可能となった。
  • 多様なクラスタリング目的関数にわたり、最小限のオーバーヘッドでほぼ最適なcoresetサイズが達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。