Skip to main content
QUICK REVIEW

[論文レビュー] Modern hierarchical, agglomerative clustering algorithms

Daniel Müllner|arXiv (Cornell University)|Sep 12, 2011
Advanced Clustering Algorithms Research被引用数 369
ひとこと要約

本稿では、任意の距離更新方式を効率的に処理できる新しい汎用凝集型クラスタリングアルゴリズムを紹介する。このアルゴリズムは、重心法および中央値法の連結法において、既存の手法を著しく上回る性能を発揮する。本稿では、ロールフのアルゴリズムおよびマーチャーのアルゴリズムの正しさを証明し、各連結法の最適なアルゴリズムの推奨を確立するとともに、R言語およびPython用の実装を提供し、標準的なクラスタリングソフトウェアにおける理論と実践の溝を埋める。

ABSTRACT

This paper presents algorithms for hierarchical, agglomerative clustering which perform most efficiently in the general-purpose setup that is given in modern standard software. Requirements are: (1) the input data is given by pairwise dissimilarities between data points, but extensions to vector data are also discussed (2) the output is a "stepwise dendrogram", a data structure which is shared by all implementations in current standard software. We present algorithms (old and new) which perform clustering in this setting efficiently, both in an asymptotic worst-case analysis and from a practical point of view. The main contributions of this paper are: (1) We present a new algorithm which is suitable for any distance update scheme and performs significantly better than the existing algorithms. (2) We prove the correctness of two algorithms by Rohlf and Murtagh, which is necessary in each case for different reasons. (3) We give well-founded recommendations for the best current algorithms for the various agglomerative clustering schemes.

研究の動機と目的

  • 階層的クラスタリングにおける理論的進展と、標準的なソフトウェアにおける非最適な実装との間のギャップを埋める。
  • 現代の統計ソフトウェアで一般的に用いられる入出力形式に適合した、効率的で正しく実用的な凝集型クラスタリングアルゴリズムを開発する。
  • ロールフのMSTベースの単一連結法およびマーチャーの近隣ノードチェーンアルゴリズムを含む、これまで未証明であったアルゴリズムの形式的正しさの証明を提供する。
  • 理論的および実験的分析に基づき、7つの主要な凝集型クラスタリング方式の各々に対して最良のパフォーマンスを示すアルゴリズムを推奨する。
  • ユークリッド距離に基づく方式(例:ウォード法、重心法、中央値法)を想定した、ベクトルデータへの効率的適応法を提案する。

提案手法

  • 距離の更新方式に応じて動的に近隣候補を維持し、優先度付きキューとインプレース配列更新を用いてクラスタ間距離を更新する新しい汎用クラスタリングアルゴリズム(Generic_linkageおよびその変種)を提案する。
  • 単一連結法のクラスタリングに最小全域木(MST)アルゴリズムを適応させ、距離計算をリアルタイムで行い、メモリ使用量を削減する。
  • 完全連結法、平均連結法、重み付き連結法、ウォード法の各々に、重心に基づく距離更新を用いたマーチャーの近隣ノードチェーンアルゴリズムを適用する。
  • 段階的デンドログラムを出力データ構造として用いることで、R や SciPy などの標準ソフトウェアとの互換性を確保する。
  • C++ で実装し、R および Python へのインターフェースを提供することで、実用的なデプロイを可能にする。
  • 各クラスタをラベルで表現する動的データ構造を採用し、近隣ノードを優先度付きキュー(mindist)で追跡することで、重複する距離計算を回避する。

実験結果

リサーチクエスチョン

  • RQ1一般用途の入出力形式を想定した場合、どの凝集型クラスタリングアルゴリズムがすべての標準的な連結法において最適に動作するか?
  • RQ2既存のソフトウェア実装がなぜ非最適なのか。理論的な改善を実用的用途に効果的に橋渡しするにはどうすればよいか?
  • RQ3ロールフのMSTベースのアルゴリズムおよびマーチャーの近隣ノードチェーンアルゴリズムの正しさの条件は何か。なぜそれらの証明がこれまで存在しなかったのか?
  • RQ4出力データ構造の選択(例:段階的デンドログラム)が、アルゴリズムの正当性および効率性にどのように影響するか?
  • RQ5任意の距離更新式をサポートしつつも、高いパフォーマンスを維持できる単一の汎用アルゴリズムを設計できるか?

主な発見

  • 提案された Generic_linkage アルゴリズムは、重心法および中央値法の連結法において、既存の手法を上回る性能を発揮し、その簡略化された変種(Generic_linkage_variant)は実際の計算再計算を削減することが確認された。
  • ロールフのMSTベースの単一連結法アルゴリズムおよびマーチャーの近隣ノードチェーンアルゴリズム(完全/平均/重み付き/ウォード連結法用)の正しさが、初めて形式的に証明された。
  • MST アルゴリズムにより、事前の全類似度行列の計算を不要とし、リアルタイムでの距離計算が可能になり、メモリ使用量が削減された。
  • ユークリッド距離に基づくベクトルデータに対しては、Generic_linkage アルゴリズムおよびその変種が、ウォード法、重心法、中央値法において最適であり、効率的な近隣ノード追跡によるパフォーマンス向上が得られた。
  • 段階的デンドログラムが、アルゴリズムの正当性を保証し、標準ソフトウェアとの互換性を確保するための必要十分な出力構造であることが示された。
  • 一般の類似度入力設定において、いかなるアルゴリズムも Ω(N²) の時間計算量を下回ることは不可能であることが確立され、理論的下界が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。