Skip to main content
QUICK REVIEW

[論文レビュー] Online Hierarchical Clustering Approximations

Aditya Krishna Menon, Anand Rajagopalan|arXiv (Cornell University)|Sep 20, 2019
Advanced Clustering Algorithms Research参考文献 18被引用数 4
ひとこと要約

本稿では、最適な階層的クラスタリングのためのMoseley-Wang (MW)収益関数を近似する2つのオンライン階層的クラスタリングアルゴリズム、OTDとOHACを提案する。OTDは、データの分離条件下で$\frac{\beta}{3}$-近似保証を有するトップダウンアプローチを採用する。一方、OHACは、新しいスプリット・マージ手順を用いてオフラインHACを模倣し、近似的に最適なMW収益を達成するとともに、$O(n)$のラウンドごとの計算量を実現し、優れたクラスタ品質を達成する。

ABSTRACT

Hierarchical clustering is a widely used approach for clustering datasets at multiple levels of granularity. Despite its popularity, existing algorithms such as hierarchical agglomerative clustering (HAC) are limited to the offline setting, and thus require the entire dataset to be available. This prohibits their use on large datasets commonly encountered in modern learning applications. In this paper, we consider hierarchical clustering in the online setting, where points arrive one at a time. We propose two algorithms that seek to optimize the Moseley and Wang (MW) revenue function, a variant of the Dasgupta cost. These algorithms offer different tradeoffs between efficiency and MW revenue performance. The first algorithm, OTD, is a highly efficient Online Top Down algorithm which provably achieves a 1/3-approximation to the MW revenue under a data separation assumption. The second algorithm, OHAC, is an online counterpart to offline HAC, which is known to yield a 1/3-approximation to the MW revenue, and produce good quality clusters in practice. We show that OHAC approximates offline HAC by leveraging a novel split-merge procedure. We empirically show that OTD and OHAC offer significant efficiency and cluster quality gains respectively over baselines.

研究の動機と目的

  • 大規模なストリーミングデータ向けに、効率的で理論的裏付けのあるオンライン階層的クラスタリングアルゴリズムの不足を解消すること。
  • MoseleyとWang (2017)の収益関数を最適化するオンラインアルゴリズムを設計すること。これは階層的クラスタリングの品質に対する原理的基準である。
  • オンライン設定において、計算効率とクラスタ品質のバランスを取ること。
  • 理論的近似保証と、オフラインベースラインおよび既存のオンライン手法との実験的検証を提供すること。

提案手法

  • OTDは、各入力点に対して1回のルートからリーフへの木探索を実行するオンライントップダウン階層的クラスタリングアルゴリズムであり、$d$ を階層の深さとして、$O(d)$ のラウンドごとの時間計算量を保証する。
  • OTDは、データポイントの分離度を表す$\beta$ を用いて、MW収益の$\frac{\beta}{3}$-近似を達成し、良好に分離された条件下では$\frac{1}{3}$-近似を達成する。
  • OHACは、オフラインHACのオンライン版であり、動的かつ階層的構造を維持するための新しいスプリット・マージ手順を用いて、オフラインHACの階層を近似的に再現する。
  • OHACは、特定のリンクエージョンに対して$O(n)$のラウンドごとの時間計算量を示し、オフラインHACとほぼ同等のMW収益性能を達成する。
  • アルゴリズムの評価には、MW収益と三重距離を用い、オフラインHACに対する近似品質を測定する。
  • 理論的分析では、データ分離仮定の下での近似境界の証明が行われ、実験的評価では、MNISTやImageNetを含む合成および実世界のデータセットが用いられる。

実験結果

リサーチクエスチョン

  • RQ1オンライン階層的クラスタリングアルゴリズムは、Moseley-Wang収益関数に対して理論的近似保証を達成できるか?
  • RQ2クラスタ品質と実行時間の観点から、オンラインアルゴリズムはオフラインHACに比べてどの程度の性能を示すか?
  • RQ3OTDのようなシンプルで効率的なトップダウンオンラインアルゴリズムは、その単純さにもかかわらず、強力な近似要因を達成できるか?
  • RQ4スプリット・マージ機構を介してオフラインHACを模倣するオンラインアルゴリズムは、階層的構造を保持し、MW収益を向上させることができるか?
  • RQ5オンライン階層的クラスタリングにおいて、計算効率とクラスタ品質のトレードオフはどのようなものか?

主な発見

  • OTDは、厳密なデータ分離がなくても、実世界および合成データセットにおいて、理論的$\frac{1}{3}$-近似要因を常に達成または上回るMW収益を達成する。
  • OHACは、オフラインHACとほぼ同一のMW収益性能を達成し、最適な階層を近似的に再現できる能力を裏付けている。
  • オフラインHACは最高のクラスタ品質を生み出すが、ImageNetのような大規模データセットでは実行不可能であり、7万点でメモリ不足に陥る。
  • OTDは、OHACおよびオフラインHACよりも顕著に高速であり、実行時間は部分線形に増加するため、高スループットのストリーミングアプリケーションに適している。
  • OHACは、三重距離においてPERCHおよび他のベースラインを上回り、既存のオンライン手法と比較して階層的構造の保存が優れていることが示された。
  • 100万点を超えるImageNetデータセットにおいて、OTDおよびOHACは合理的な時間内に処理を完了するが、オフラインHACは8時間以内に処理を終了できなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。