[論文レビュー] Hierarchical Clustering via Sketches and Hierarchical Correlation Clustering
本稿では、すべての重みが小さい場合を除き、定数サイズのスケッチを備えた階層的クラスタリング木が、リベニューおよび不一致の目的関数に対して最適解を任意に近い精度で近似できることを示す構造的補題を導入する。これにより、これらの目的関数に対して効率的多項式時間の確率的近似スキーム(Efficient-PRAS)が達成され、類似性・不一致の両方のインスタンスを扱う階層的相関クラスタリング(HCC)が提案され、0.4767の近似比と、補完的類似性/不一致インスタンスに対するEfficient-PRASを提供する。
Recently, Hierarchical Clustering (HC) has been considered through the lens of optimization. In particular, two maximization objectives have been defined. Moseley and Wang defined the \\emph{Revenue} objective to handle similarity information given by a weighted graph on the data points (w.l.o.g., $[0,1]$ weights), while Cohen-Addad et al. defined the \\emph{Dissimilarity} objective to handle dissimilarity information. In this paper, we prove structural lemmas for both objectives allowing us to convert any HC tree to a tree with constant number of internal nodes while incurring an arbitrarily small loss in each objective. Although the best-known approximations are 0.585 and 0.667 respectively, using our lemmas we obtain approximations arbitrarily close to 1, if not all weights are small (i.e., there exist constants $\\epsilon, \\delta$ such that the fraction of weights smaller than $\\delta$, is at most $1 - \\epsilon$); such instances encompass many metric-based similarity instances, thereby improving upon prior work. Finally, we introduce Hierarchical Correlation Clustering (HCC) to handle instances that contain similarity and dissimilarity information simultaneously. For HCC, we provide an approximation of 0.4767 and for complementary similarity/dissimilarity weights (analogous to $+/-$ correlation clustering), we again present nearly-optimal approximations.
研究の動機と目的
- 既存の階層的クラスタリング(HC)近似アルゴリズムが最適解から離れている(例:0.585および0.667)という制限に対処すること。
- 近似比を1に任意に近づけることのできる、広範なHCインスタンスのクラスを同定し、問題の固有のAPX-hard性を克服すること。
- 階層的クラスタリングにおける類似性と不一致の情報を統合するために、階層的相関クラスタリング(HCC)を導入すること。
- HCCに対して効率的な近似スキームを提供すること、特に補完的類似性/不一致(±)重みを有するインスタンスにおいて。
- 度合いに基づく類似性インスタンスおよび最小類似度が有界なガウスカーネルに基づくインスタンスが、ほぼ最適な近似を許容するインスタンスのクラスに含まれることを示すこと。
提案手法
- 木のスケッチ(すべてのリーブを削除した後の木)の概念を導入し、リベニューや不一致の目的関数に対して、最適HC木を近似するために定数サイズのスケッチで十分であることを証明する。
- Goldreichら(1998)のMax-Uncut Bisectionに関する古典的業績を活用し、すべての重みが小さい場合を除くインスタンスに対して近似アルゴリズムを設計する。
- Max-Uncut Bisectionとグリーディ分割を組み合わせたハイブリッドアルゴリズムを提案し、HCCに対して0.4767の近似比を達成する。
- 2つのサブルーチンを並列に実行する同時アルゴリズム(ALG±)を設計し、より良いHC木を返すことで、HCC±目的関数に対してEfficient-PRASを達成する。
- 構造的補題を用いて、任意のHC木を定数サイズのスケッチを持つ木に置き換える際の損失を制限し、有限の候補木の集合に対する効率的な探索を可能にする。
- Alonら(2020)のMax-Uncut Bisectionに対する0.8776-近似を、近似フレームワークの主要構成要素として適用する。
実験結果
リサーチクエスチョン
- RQ1リベニューおよび不一致の目的関数において、既知の0.585および0.667の境界を超えて、近似比を1に任意に近づけることは可能か?
- RQ2問題の固有のAPX-hard性が、ほぼ最適な近似を妨げない自然なHCインスタンスのクラスは存在するか?
- RQ3新しい目的関数を導入することで、階層的クラスタリングにおける類似性と不一致の情報を統合できるか? もしそうなら、どのような近似保証が達成できるか?
- RQ4HCC目的関数はEfficient-PRASを満たすか? 特に補完的類似性/不一致重みを有するインスタンスにおいて。
- RQ5度合いに基づく類似性インスタンスおよび最小類似度が有界なガウスカーネルに基づくインスタンスは、ほぼ最適な近似を許容するインスタンスのクラスに含まれるか?
主な発見
- リベニューおよび不一致の目的関数の両方において、本稿は任意のHC木が、定数サイズのスケッチを持つ木に置き換えられることを証明し、目的関数値の損失を任意に小さくできることを示している。
- すべての重みが小さい場合を除き(つまり、ある定数δ > 0以上の重みが定数割合を占める場合)、リベニューおよび不一致の目的関数に対してEfficient-PRASを達成している。
- 本手法は、先行研究の近似を改善する:δ = Ω(1)のガウスカーネルインスタンスにおいて、近似比は(1+δ)/3から任意に最適に近づくようになった。
- 本稿は、類似性と不一致の情報を同時に扱える階層的相関クラスタリング(HCC)を導入し、最悪ケースの近似比が0.4767であることを示している。
- HCC±目的関数(補完的類似性/不一致)に対してEfficient-PRASを達成し、問題がNP完全であるが、任意の所望の精度で効率的に近似可能であることを示している。
- 本フレームワークは、度合いに基づく類似性インスタンスに適用可能であり、低次元設定における良い近似が得られることを解決した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。