Skip to main content
QUICK REVIEW

[論文レビュー] An Information-Theoretic Analysis of Hard and Soft Assignment Methods for Clustering

Michael Kearns, Yishay Mansour|arXiv (Cornell University)|Feb 6, 2013
Advanced Clustering Algorithms Research被引用数 13
ひとこと要約

本稿では、硬い割り当て(K-means)とやわらかい割り当て(EM)のクラスタリング手法について情報理論的分析を行い、K-meansがエントロピーを介してクラスタ類似度とクラスタバランスの間で暗黙的にバランスをとっているのに対し、EMは尤度を優先することを示している。主な貢献は、K-meansがEMよりも重なりが少ないクラスタ密度を好むことの裏付けとなる歪み分解であり、類似したやわらかい割り当ての精神を持つが、動作が著しく異なる新しい事後割り当て手法の導入である。

ABSTRACT

Assignment methods are at the heart of many algorithms for unsupervised learning and clustering - in particular, the well-known K-means and Expectation-Maximization (EM) algorithms. In this work, we study several different methods of assignment, including the "hard" assignments used by K-means and the ?soft' assignments used by EM. While it is known that K-means minimizes the distortion on the data and EM maximizes the likelihood, little is known about the systematic differences of behavior between the two algorithms. Here we shed light on these differences via an information-theoretic analysis. The cornerstone of our results is a simple decomposition of the expected distortion, showing that K-means (and its extension for inferring general parametric densities from unlabeled sample data) must implicitly manage a trade-off between how similar the data assigned to each cluster are, and how the data are balanced among the clusters. How well the data are balanced is measured by the entropy of the partition defined by the hard assignments. In addition to letting us predict and verify systematic differences between K-means and EM on specific examples, the decomposition allows us to give a rather general argument showing that K ?means will consistently find densities with less "overlap" than EM. We also study a third natural assignment method that we call posterior assignment, that is close in spirit to the soft assignments of EM, but leads to a surprisingly different algorithm.

研究の動機と目的

  • 最尤推定や歪み最小化という最適化目的を超えて、硬い割り当て(K-means)とやわらかい割り当て(EM)のクラスタリング手法の系統的差異を理解すること。
  • 硬い割り当てのエントロピーで測定されるクラスタバランスが、クラスタリングアルゴリズムの歪みに与える影響を分析すること。
  • K-meansにおけるクラスタ内類似度とクラスタバランスの間の暗黙的トレードオフを形式化し、パラメトリック密度推定への一般化を行うこと。
  • EMと類似した精神を持つが、動作が著しく異なる新しい事後割り当て手法を導入・分析すること。
  • K-meansがなぜEMよりも重なりが少ないクラスタ構造を発見しやすいのかを理論的根拠で説明すること。

提案手法

  • 期待歪みを2つの成分に分解する:クラスタ内類似度と硬い割り当てのエントロピーで測定されるクラスタバランス。
  • 情報理論的ツールを用いて、K-meansがクラスタ内歪みの最小化と割り当てパーティションのエントロピー最大化の間の暗黙的トレードオフを最適化していることを示す。
  • 歪み分解を応用し、K-meansと、ラベルなしデータからパラメトリック密度を推定する拡張への適用を分析する。
  • 「事後割り当て」を導入する——事後確率を用いるが、最適化目的が異なっているためEMとは根本的に異なるアルゴリズムとなる。
  • 具体的な例を用いてK-means、EM、および事後割り当ての行動を比較し、理論的予測の妥当性を検証する。
  • 理論的分析により、同じデータと初期化条件下でK-meansが常にEMよりも重なりが少ないクラスタ密度を発見することを確認する。

実験結果

リサーチクエスチョン

  • RQ1K-meansとEMの両手法が歪み最小化や尤度最大化という目的を超えて、それぞれの暗黙的最適化目的にどのような差異があるのか。
  • RQ2硬い割り当てのエントロピーで測定されるクラスタバランスは、K-meansおよび関連アルゴリズムの性能にどのような役割を果たすのか。
  • RQ3K-meansがEMよりも重なりが少ないクラスタ構造を生成する理由は何か。
  • RQ4EMと類似した確率的基盤を持つが、動作と結果が著しく異なる新しい事後割り当て手法の特徴は何か。
  • RQ5K-meansとEMクラスタリングの系統的差異を統一的な情報理論的枠組みで説明可能か。

主な発見

  • K-meansの歪みは、クラスタ内類似度を測る項と、硬い割り当てのエントロピーで測るクラスタバランスを測る項に分解可能であり、暗黙のトレードオフが明らかになる。
  • K-meansは、よりバランスの取れた(エントロピーが高い)割り当てと重なりが少ないクラスタを暗黙的に好むため、疎で明確に分離されたクラスタ構造が得られる。
  • EMのやわらかい割り当てと類似した精神を持つが、最適化目的が異なるため、事後割り当て手法は根本的に異なるアルゴリズムとなり、収束性やクラスタリング行動も著しく異なる。
  • 理論的分析により、同じデータと初期化条件下でK-meansが常にEMよりも重なりが少ないクラスタ密度を発見することが確認された。
  • 実験例により、歪み分解がK-meansとEMの間で観察可能なクラスタリング結果の差を的確に予測できることを検証した。
  • 本分析により、K-meansがEMよりも重なりが少ないクラスタ構造を発見しやすいという一般的な傾向が理論的に裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。