[論文レビュー] Further heuristics for $k$-means: The merge-and-split heuristic and the $(k,l)$-means
本稿では、局所最適解から脱出するために、マージ・スプリット $k$-means ヒューリスティクスと $(k,l)$-means 目的関数を導入し、$k$-means 集合化を改善する。Lloyd 法および Hartigan 法を、空のクラスタおよび1点クラスタに対応させるために部分的再設定を可能にするように拡張し、$l>1$ の $(k,l)$-means が標準 $k$-means に緩和可能であることを示し、より良い解が得られることを示している。特に再起動回数が限られた状況下で顕著な改善が見られ、Iris データセットにおいて標準 $k$-means に比べ最大 80.55% の改善が実証された。
Finding the optimal $k$-means clustering is NP-hard in general and many heuristics have been designed for minimizing monotonically the $k$-means objective. We first show how to extend Lloyd's batched relocation heuristic and Hartigan's single-point relocation heuristic to take into account empty-cluster and single-point cluster events, respectively. Those events tend to increasingly occur when $k$ or $d$ increases, or when performing several restarts. First, we show that those special events are a blessing because they allow to partially re-seed some cluster centers while further minimizing the $k$-means objective function. Second, we describe a novel heuristic, merge-and-split $k$-means, that consists in merging two clusters and splitting this merged cluster again with two new centers provided it improves the $k$-means objective. This novel heuristic can improve Hartigan's $k$-means when it has converged to a local minimum. We show empirically that this merge-and-split $k$-means improves over the Hartigan's heuristic which is the {\em de facto} method of choice. Finally, we propose the $(k,l)$-means objective that generalizes the $k$-means objective by associating the data points to their $l$ closest cluster centers, and show how to either directly convert or iteratively relax the $(k,l)$-means into a $k$-means in order to reach better local minima.
研究の動機と目的
- 初期化の質が悪いか $k/d$ が高いため、$k$-means ヒューリスティクスが悪い局所最適解に陥るという問題を解決すること。
- 古典的 $k$-means ヒューリスティクス(Lloyd 法および Hartigan 法)を、空のクラスタおよび1点クラスタに対応させるために、部分的再設定を可能にするように拡張すること。
- 目的関数の改善が可能な場合にクラスタを再構成できる、新規のマージ・スプリット $k$-means ヒューリスティクスを提案し、Hartigan 法を上回る性能を実現すること。
- 標準 $k$-means 目的関数を一般化し、$(k,l)$-means を導入することで、各点をその $l$ 番目に近い中心に割り当てる仕組みを提供し、標準 $k$-means への緩和方法を示すこと。
- $(k,l)$-means およびその段階的緩和が、標準 $k$-means よりも優れていることを実験的に検証すること。特に再起動回数が限られた状況下で顕著な優位性を示すこと。
提案手法
- 空のクラスタを処理するため、Lloyd 法を拡張し、再配置時にクラスタ中心を再割り当てする。このようなイベントを部分的再設定の機会とみなす。
- 1点クラスタを処理するため、Hartigan の1点移動ヒューリスティクスを拡張し、再割り当てと再中心化を可能にする。これらのイベントを再設定のトリガーとみなす。
- マージ・スプリット $k$-means ヒューリスティクスを提案:2つのクラスタをマージし、$k$-means 目的関数が改善する場合に、更新された中心を持つ2つの新しいクラスタに再分割する。
- $(k,l)$-means 目的関数を導入。各点をその $l$ 番目に近いクラスタ中心に割り当てる。標準 $k$-means 目的関数の一般化である。
- 2つの変換戦略を提案:直接割り当て(最も近い中心のみを保持)または反復的緩和($(k,l)$-means から $(k,l-1)$-means に段階的に中心を削除)により、標準 $k$-means に到達する。
- $(k,l)$-means を局所最適解から脱出するための前処理として用い、その後、変換または緩和により最終的な $k$-means の微調整を実施する。
実験結果
リサーチクエスチョン
- RQ1空のクラスタおよび1点クラスタのイベントが、$k$-means ヒューリスティクスにおける部分的再設定の機会として活用可能であり、収束性の向上に寄与するか?
- RQ2提案されたマージ・スプリット $k$-means ヒューリスティクスは、Hartigan 法を上回り、局所最適解からの脱出に有効か?
- RQ3$l>1$ の $(k,l)$-means 目的関数は、最適化の地形を滑らかにし、標準 $k$-means よりも優れた局所最適解をもたらすか?
- RQ4$(k,l)$-means を標準 $k$-means に緩和する手法は、解の品質および初期化へのロバストネスの観点でどの程度有効か?
- RQ5再起動回数が限られた状況下で、$(k,l)$-means の変換または緩和は、標準 $k$-means を一貫して上回るか?
主な発見
- マージ・スプリット $k$-means ヒューリスティクスは、デファクトスタンダードである Hartigan 法を上回り、目的関数の改善が可能な場合にクラスタを再構成できる点で優位性を示す。
- Iris データセットにおいて、10,000回の再起動を実施した結果、$k=6$ の場合、変換された $(k,2)$-means は標準 $k$-means より 80.55% の試行で優れた性能を示した。
- 再起動回数が限られた状況下で、Iris データセットにおいて $l=2$ の $(k,l)$-means は 80% のケースで標準 $k$-means を上回った。
- $(k,l)$-means から標準 $k$-means への段階的緩和(遠い中心を順次削除)は、直接 $k$-means を用いる場合よりも優れた解をもたらし、特に $k$ が大きい場合に顕著である。
- $k=10$ の場合、$(k,3)$-means の緩和は標準 $k$-means に対して 82.5% の試行で優れた性能を示し、平均スコアは $k$-means の 28.02 対 $(k,3)$-means の 27.76 であった。
- $(k,l)$-means の手法は最適化の地形を滑らかにし、悪い局所最適解の数を減らす一方で、最良の最適解の品質を維持または向上させる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。