Skip to main content
QUICK REVIEW

[論文レビュー] Rk-means: Fast Clustering for Relational Data

Ryan R. Curtin, Ben Moseley|arXiv (Cornell University)|Oct 11, 2019
Data Mining Algorithms and Applications参考文献 34被引用数 5
ひとこと要約

Rk-means は、関係データベース上で完全なデータ行列を物性化せずに、高速で近似可能な k-means クラスタリングを可能にする新規なアルゴリズムである。この手法は、マージナル関係から小さなグリッドコアセットを構築し、k-means 目的関数に対して定数倍の近似を達成するとともに、高価な特徴抽出クエリを必要とする従来手法と比べて、数個のオーダーの高速化を実現する。

ABSTRACT

Conventional machine learning algorithms cannot be applied until a data matrix is available to process. When the data matrix needs to be obtained from a relational database via a feature extraction query, the computation cost can be prohibitive, as the data matrix may be (much) larger than the total input relation size. This paper introduces Rk-means, or relational k -means algorithm, for clustering relational data tuples without having to access the full data matrix. As such, we avoid having to run the expensive feature extraction query and storing its output. Our algorithm leverages the underlying structures in relational data. It involves construction of a small {\it grid coreset} of the data matrix for subsequent cluster construction. This gives a constant approximation for the k -means objective, while having asymptotic runtime improvements over standard approaches of first running the database query and then clustering. Empirical results show orders-of-magnitude speedup, and Rk-means can run faster on the database than even just computing the data matrix.

研究の動機と目的

  • 関係データベースからクラスタリングの前に大きなデータ行列を生成するために必要な高コストな特徴抽出クエリ(FEQ)の計算コストとストレージコストを低減すること。
  • 完全なデータ行列を物性化せずに、関係データ上で直接 k-means クラスタリングを可能にし、FEQ の性能ボトルネックを回避すること。
  • マージナル関係から導出されたコンパクトなコアセットを用いて、k-means 目的関数に対する証明可能に良い近似を提供すること。
  • 完全なデータ行列を事前に計算・クラスタリングする標準的な k-means パipラインと比較して、漸近的および実測的な高速化を達成すること。

提案手法

  • Rk-means は、軽量な k-means 変種を用いて、個々の関係テーブル(例:製品、店舗、取引)を別々にクラスタリングすることでグリッドコアセットを構築する。
  • この手法は、関係データの要因分解構造と機能的集計クエリ(FAQ)技術を活用し、完全なデータ行列を物性化せずに、関係の直積上の重み付き k-means を効率的に計算する。
  • マージナル関係上で動的計画法に基づくクラスタリング手法を用いて、結合分布を要約する小さな代表的グリッドコアセットを構築する。
  • コアセットを用いて、関係間のタプル組み合わせの頻度から導出される重みを用いて、全データ空間上の重み付き k-means クラスタリングを計算する。
  • コアセットと最適輸送の理論的枠組みを結びつけることで、真の k-means 目的関数に対して定数倍の近似を保証する。
  • コアセット構築時に使用するクラスタ数($\kappa$)を最終的な $k$ クラスタに対して調整することで、速度と近似精度の間で調整可能なトレードオフを実現する。

実験結果

リサーチクエスチョン

  • RQ1特徴抽出クエリの計算コストを回避するために、完全なデータ行列を物性化せずに、関係データ上で k-means クラスタリングが可能か?
  • RQ2マージナル関係テーブルから構築されたコアセットが、k-means 目的関数に対して理論的にどの程度の近似保証を持つのか?
  • RQ3データ行列が大きい場合、Rk-means の実行時間とメモリ使用量は、標準的な k-means パイプラインと比べてどの程度の性能を示すか?
  • RQ4コアセットの構築が十分に効率的であるため、実際にデータ行列を計算する時間を上回る性能向上が達成可能か?
  • RQ5コアセットサイズ($\kappa$)のチューニングが、速度とクラスタリング品質のトレードオフに与える影響は何か?

主な発見

  • Rk-means は、Retailer データセットにおいて mlpack に対して最大 115× の高速化を達成し、$\kappa < k$ の場合に最大 208× の高速化を実現したが、依然として中程度の近似誤差を維持した。
  • Favorita データセットでは、$k=50$ の場合、Rk-means は 334.65 秒でクラスタリングを完了したが、mlpack は 6 時間後にタイムアウトした。これは顕著なスケーラビリティの向上を示している。
  • Rk-means のメモリ使用量は大幅に削減された。$k=20$ の同じデータセットで、mlpack が 900 GiB 以上を要したのに対し、Rk-means は 18 GiB にまで抑えられ、標準的手法が失敗する状況でもメモリ内クラスタリングが可能になった。
  • コアセットサイズは、完全なデータ行列と比べて最大 180 倍も小さく、クラスタリング品質に妥協を来さずに効率的な計算が可能になった。
  • Rk-means の相対的近似誤差は、理論的 9-近似境界を常に下回り、一部の設定では 0.00 まで低下した。
  • すべてのデータセットにおいて、Rk-means は psql を用いたデータ行列計算よりも速く実行された。これは、コアセットアプローチがベースラインの FEQ ステップよりも高速かつ効率的であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。