Skip to main content
QUICK REVIEW

[論文レビュー] Subspace Clustering using Ensembles of $K$-Subspaces

John Lipor, David Hong|arXiv (Cornell University)|Sep 14, 2017
Face and Expression Recognition参考文献 51被引用数 8
ひとこと要約

本稿では、ランダムな初期化を用いたK-部分空間法の複数回の実行を、証拠蓄積クラスタリングによって統合する新しい幾何学的部分空間クラスタリング手法、Ensemble K-Subspaces (EKSS) を提案する。EKSSは、コンセンサスクラスタリングに基づく共起性類似度行列を構築し、実験的に最先端の性能を達成するとともに、単調な内積に基づく類似度モデル下での証拠蓄積クラスタリングおよびK-部分空間法の変種に対する、初めての理論的回復保証を提供する。

ABSTRACT

Subspace clustering is the unsupervised grouping of points lying near a union of low-dimensional linear subspaces. Algorithms based directly on geometric properties of such data tend to either provide poor empirical performance, lack theoretical guarantees, or depend heavily on their initialization. We present a novel geometric approach to the subspace clustering problem that leverages ensembles of the K-subspaces (KSS) algorithm via the evidence accumulation clustering framework. Our algorithm, referred to as ensemble K-subspaces (EKSS), forms a co-association matrix whose (i,j)th entry is the number of times points i and j are clustered together by several runs of KSS with random initializations. We prove general recovery guarantees for any algorithm that forms an affinity matrix with entries close to a monotonic transformation of pairwise absolute inner products. We then show that a specific instance of EKSS results in an affinity matrix with entries of this form, and hence our proposed algorithm can provably recover subspaces under similar conditions to state-of-the-art algorithms. The finding is, to the best of our knowledge, the first recovery guarantee for evidence accumulation clustering and for KSS variants. We show on synthetic data that our method performs well in the traditionally challenging settings of subspaces with large intersection, subspaces with small principal angles, and noisy data. Finally, we evaluate our algorithm on six common benchmark datasets and show that unlike existing methods, EKSS achieves excellent empirical performance when there are both a small and large number of points per subspace.

研究の動機と目的

  • 幾何学的部分空間クラスタリング手法が、しばしば低い実験的性能、理論的保証の欠如、または初期化に依存しやすいという限界を是正すること。
  • 2点間の絶対内積の単調変換に近い類似度行列に適用可能な一般化された回復フレームワークを構築すること。
  • コンセンサスクラスタリングを通じて、クラスタリングのロバスト性と精度を向上させる、新しいアンサンブルベースのK-部分空間アルゴリズム(EKSS)を設計すること。
  • 証拠蓄積クラスタリングおよびK-部分空間法のいかなる変種に対しても、初めての理論的回復保証を提供すること。
  • 特に、部分空間ごとの点数が少ないか、多い設定においても、多様なベンチマークデータセットで優れた実験的性能を示すこと。

提案手法

  • EKSSは、K-部分空間法を複数回ランダムな初期化で実行し、その結果を統合して共起性行列を構築する証拠蓄積クラスタリングフレームワークを採用する。
  • 共起性行列の要素(i,j)は、すべての実行回数において点iと点jが同じクラスタに属した回数を数えるものであり、これが類似度行列を形成する。
  • 本手法は、K-部分空間法の最初の反復が、データポイント間の絶対内積の単調関数に近い類似度行列要素を生成することを証明する。
  • これにより、EKSSは、内積に基づく類似度の単調性に依拠する状況下で、最先端のアルゴリズムと同等の理論的回復保証を継承できる。
  • 正規化後、必要に応じてホワイトニングおよび次元削減を施した後、合成データおよび実世界のデータセットに適用する。
  • 公平な比較のため、EKSSは1000回の試行を実施し、誤差が最小となるクラスタリング結果を選択し、各データセットごとにパラメータを最適化する。

実験結果

リサーチクエスチョン

  • RQ1ランダム初期化を用いたK-部分空間法のアンサンブルは、挑戦的な条件下でも、ロバストで正確な部分空間クラスタリングを達成できるか?
  • RQ2K-部分空間法を用いた証拠蓄積クラスタリングは、理論的回復保証を満たす類似度行列を生成できるか?
  • RQ32点間の絶対内積の単調変換が、証明可能に正しい部分空間クラスタリングの基盤として機能できるか?
  • RQ4部分空間ごとの点数が異なるベンチマークデータセットにおいて、EKSSは最先端の手法と比較してどのように性能を発揮するか?
  • RQ5ホワイトニングや次元削減などのデータ前処理の影響は、EKSSおよび他のアルゴリズムの性能にどのように及ぶか?

主な発見

  • EKSSは、Hopkins-155、Yale、COIL-20、COIL-100、USPS、MNIST-10kの6つのベンチマークデータセットにおいて、実験的に最先端の性能を達成した。
  • 合成データを用いた実験により、部分空間の重なりが大きく、主軸間の角度が小さい、ノイズの多い状況でも良好な性能を示した。
  • 多くの既存手法が失敗するような、部分空間ごとの点数が少ないか、多い設定でも、EKSSは強固な性能を維持した。
  • 理論的解析により、EKSSの類似度行列が絶対内積の単調変換に近いことが示され、最先端のアルゴリズムと同様の条件下で証明可能な回復が可能であることが分かった。
  • 本研究は、証拠蓄積クラスタリングおよびK-部分空間法のいかなる変種に対しても、初めての理論的回復保証を提供した。
  • Hopkins-155データセットではd=3、q=2のクラスタリング誤差を達成し、Yaleデータセットではd=2、q=6を達成した。これは、多様なデータ構造に対して優れた性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。