Skip to main content
QUICK REVIEW

[論文レビュー] Generalizing k-means for an arbitrary distance matrix

Balázs Szalkai|arXiv (Cornell University)|Mar 24, 2013
Data Management and Algorithms参考文献 4被引用数 3
ひとこと要約

この論文は、データポイントがユークリッド空間に表現されていなくても動作するように、k-meansクラスタリングを任意の距離行列に一般化する。重心までの距離を二乗距離行列上の二次形式として表現することにより、ベクトル入力を必要としないk-meansの実行が可能となり、非ユークリッド的および抽象的なデータタイプへの適用範囲が拡張される。

ABSTRACT

The original k-means clustering method works only if the exact vectors representing the data points are known. Therefore calculating the distances from the centroids needs vector operations, since the average of abstract data points is undefined. Existing algorithms can be extended for those cases when the sole input is the distance matrix, and the exact representing vectors are unknown. This extension may be named relational k-means after a notation for a similar algorithm invented for fuzzy clustering. A method is then proposed for generalizing k-means for scenarios when the data points have absolutely no connection with a Euclidean space.

研究の動機と目的

  • 標準k-meansが重心計算のためにはデータポイントがユークリッド空間に存在することを要するという制限に対処する。
  • 元のベクトル表現が得られない状況でも、距離行列のみが利用可能な場合にk-meansクラスタリングを可能にする。
  • 任意の(非メトリックである可能性のある)距離行列に対して、重心距離を二次形式によって再定義することでk-meansを一般化する。
  • 行列演算に伴う複雑性の増加にもかかわらず、一般化手法が計算的に実行可能であることを保証する。
  • 解釈可能性を維持するため、一般化された手法が意味のある非負の距離を出力する条件を特定する。

提案手法

  • データポイントを二乗距離行列 $ A \in \mathbb{R}^{n \times n} $ で表現する。ここで $ A_{ij} = ||p_i - p_j||^2 $ であり、$ p_i $ が明示的に与えられていない場合でも可とする。
  • 点 $ p_i $ からそのクラスタ重心 $ z_i $ までの二乗距離を二次形式として表現する:$ ||p_i - z_i||^2 = -\frac{1}{2} \lambda^T A \lambda $、ここで $ \lambda = \frac{1}{|S|}\chi(S) - e_i $ かつ $ \sum \lambda_j = 0 $。
  • $ \sum \lambda_j = 0 $ である性質を用いて、二次形式の表現を導出し、元のベクトルに依存しない距離行列 $ A $ のみに依存する形にする。
  • 距離行列 $ A $ がユークリッド空間由来でない場合でも、この一般化された距離式を適用することで、抽象的データ上の関係性に基づくk-meansを可能にする。
  • 二次形式がゼロ和の超平面上で負定値でない場合に生じる負の距離を回避するため、$ \beta $-スプレッド変換などの行列補正技術を用いて非負性を保証する。
  • 元の距離をできるだけ保ちつつ、二次形式がゼロ和の超平面上で負半定値になるように距離行列を最小限に修正する。

実験結果

リサーチクエスチョン

  • RQ1k-meansクラスタリングは、データポイントのベクトル表現が得られない状況でも、距離行列のみに依存して一般化可能か?
  • RQ2二乗距離行列が唯一の情報である場合、データポイントからそのクラスタ重心までの距離をどのように計算できるか?
  • RQ3一般化された重心距離が非負かつ解釈可能であるために、距離行列が満たすべき条件は何か?
  • RQ4非ユークリッド距離行列を、元の対比較距離をできるだけ保ちつつ、有効なk-meansクラスタリングを可能にするように補正可能か?
  • RQ5実世界の非ユークリッドデータに対して、一般化k-means手法の性能と解釈可能性は、標準k-meansと比べてどう異なるか?

主な発見

  • 本論文は、重心距離を行列上の二次形式として表現することで、任意の距離行列に対してk-meansを一般化することに成功した。
  • 本手法により、タンパク質配列など、元のユークリッド表現を持たないデータに対してもk-meansクラスタリングが可能となった。
  • 一般化された距離式 $ ||p_i - z_i||^2 = -\frac{1}{2} \lambda^T A \lambda $ は、$ A $ がユークリッド空間由来でない場合でも有効である。
  • 二次形式がゼロ和の超平面上で負定値でない場合、距離が負になる可能性があり、これは距離のメトリック解釈を破壊する。
  • 負の距離を解消するため、$ \beta $-スプレッド変換などの行列補正法を適用可能であり、元の距離行列の歪みを最小限に抑えられる。
  • 繰り返しの二次形式評価に起因して、標準k-meansより計算コストが高くなるが、ヒューリスティックk-meansアルゴリズムでは依然として実行可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。