Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Clustering: Objective Functions and Algorithms

Vincent Cohen-Addad, Varun Kanade|DSpace@MIT (Massachusetts Institute of Technology)|Apr 7, 2017
Advanced Clustering Algorithms Research参考文献 26被引用数 10
ひとこと要約

本稿は、階層的クラスタリングにおける「良い」目的関数を定義する公理的枠組みを導入し、存在する真のクラスタリングを好む許容可能なコスト関数を特徴づける。類似度ベースのクラスタリングでは $O(\sqrt{\log n})$-近似を達成する改善された近似アルゴリズムと、不類似度ベースのクラスタリングでは $3/2$-近似を達成するが、平均リンク法は2-近似を達成し、ストークスティックブロックモデルの仮定下ではほぼ最適に動作することが示されている。

ABSTRACT

Hierarchical clustering is a recursive partitioning of a dataset into clusters at an increasingly finer granularity. Motivated by the fact that most work on hierarchical clustering was based on providing algorithms, rather than optimizing a specific objective, Dasgupta framed similarity-based hierarchical clustering as a combinatorial optimization problem, where a `good' hierarchical clustering is one that minimizes some cost function. He showed that this cost function has certain desirable properties. We take an axiomatic approach to defining `good' objective functions for both similarity and dissimilarity-based hierarchical clustering. We characterize a set of "admissible" objective functions (that includes Dasgupta's one) that have the property that when the input admits a `natural' hierarchical clustering, it has an optimal value. Equipped with a suitable objective function, we analyze the performance of practical algorithms, as well as develop better algorithms. For similarity-based hierarchical clustering, Dasgupta showed that the divisive sparsest-cut approach achieves an $O(\log^{3/2} n)$-approximation. We give a refined analysis of the algorithm and show that it in fact achieves an $O(\sqrt{\log n})$-approx. (Charikar and Chatziafratis independently proved that it is a $O(\sqrt{\log n})$-approx.). This improves upon the LP-based $O(\log n)$-approx. of Roy and Pokutta. For dissimilarity-based hierarchical clustering, we show that the classic average-linkage algorithm gives a factor 2 approx., and provide a simple and better algorithm that gives a factor 3/2 approx.. Finally, we consider `beyond-worst-case' scenario through a generalisation of the stochastic block model for hierarchical clustering. We show that Dasgupta's cost function has desirable properties for these inputs and we provide a simple 1 + o(1)-approximation in this setting.

研究の動機と目的

  • 自然な真のクラスタリングを好む階層的クラスタリングのための『良い』目的関数を形式化し、特徴づける。
  • 実用的な階層的クラスタリングアルゴリズム(特に平均リンク法とスパーストカットに基づく手法)の最悪ケース性能を分析する。
  • 類似度ベースおよび不類似度ベースの両方の階層的クラスタリングに対して、より高速で優れた性能を発揮するアルゴリズムを開発する。
  • 一般化されたストークスティックブロックモデルを用いて、最悪ケースを超えるシナリオにおけるアルゴリズムの性能を評価する。
  • 既存のヒューリスティック手法に理論的保証を設け、先行の近似境界を改善する。

提案手法

  • 分離性(連結成分が分離されていること)と構造のないグラフにおける不変性といった公理的性質を満たす、類似度および不類似度グラフの許容可能なコスト関数の集合を導入する。
  • 類似度ベースのクラスタリングに再帰的スパーストカット法を用い、精密な解析により $O(\sqrt{\log n})$-近似を示し、従来の $O(\log n)$ の境界を改善する。
  • 不類似度ベースのクラスタリングのための新しいアルゴリズムを提案し、$3/2$-近似を達成する。これは最悪ケースにおいて平均リンク法の2-近似を上回る。
  • 一般化された階層的ストークスティックブロックモデル(HSBM)にダスガプタコスト関数を適用し、単純なアルゴリズムがこのような入力に対して $1 + o(1)$-近似を達成することを示す。
  • グラフ構造と木のトポロジーの間の全単射を活用して、定義された目的関数下で特定のクラスタリングが最適であることを再帰的マージ戦略を用いて証明する。
  • 最悪ケースの入力構成を用いて、シングルリンク法、コンプリートリンク法、および2-センターのバイセクション法が、最適解と比べて任意に悪い解を生成しうることを示す。

実験結果

リサーチクエスチョン

  • RQ1階層的クラスタリングの目的関数が自然なクラスタ構造を反映するために満たすべき公理的性質は何か?
  • RQ2平均リンク法のような既存のヒューリスティックアルゴリズムは、近似保証を通じて理論的に正当化可能か?
  • RQ3類似度ベースの階層的クラスタリングにおいて、達成可能な最悪ケース近似比の上限は何か?また、$O(\log n)$ を超えて改善可能か?
  • RQ4階層的ストークスティックブロックモデルによって生成されるような、現実的でない最悪ケースでない入力では、アルゴリズムはどのように動作するか?
  • RQ5現在のヒューリスティックを上回るより良い近似比を達成する、より高速で正確なアルゴリズムを設計可能か?

主な発見

  • 再帰的スパーストカットアルゴリズムは、類似度ベースの階層的クラスタリングにおいて $O(\sqrt{\log n})$-近似を達成し、従来の $O(\log^{3/2}n)$ の境界を改善する。
  • 不類似度ベースのクラスタリングのための新しいアルゴリズムは $3/2$-近似を達成し、最悪ケースにおいて平均リンク法の2-近似を上回る。
  • 平均リンク法は不類似度ベースのクラスタリングにおいて2-近似を達成し、これは最悪ケースでタイトである。
  • ダスガプタコスト関数は一般化された階層的ストークスティックブロックモデル(HSBM)下で良好に動作し、単純なアルゴリズムが $1 + o(1)$-近似を達成する。
  • シングルリンク法、コンプリートリンク法、およびバイセクション2-センター法は、値が $O(\text{OPT}/n)$ に達する解を生成しうることから、最悪ケースでは任意に悪い解を出力しうることが示された。
  • 本稿では、メトリック空間内での任意の解が値 $\Omega(\text{OPT})$ を有することを証明しており、これは最悪ケース近似比が有界であり意味を持つことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。