Skip to main content
QUICK REVIEW

[論文レビュー] Robust Subspace Clustering via Thresholding

Reinhard Heckel, Helmut Bölcskei|arXiv (Cornell University)|Jul 18, 2013
Face and Expression Recognition被引用数 10
ひとこと要約

本稿では、球面距離における近隣点を用いて隣接行列を構築することで、高次元データを部分空間の和集合にクラスタリングする低コストなアルゴリズムである、しきい値に基づく部分空間クラスタリング(TSC)を提案する。ノイズあり・欠損ありのデータにおいても、部分空間が重複する場合でさえ、理論的に成功することが保証されており、誤差率に関する理論的保証を有する外れ値検出スキームを含む。

ABSTRACT

The problem of clustering noisy and incompletely observed high-dimensional data points into a union of low-dimensional subspaces and a set of outliers is considered. The number of subspaces, their dimensions, and their orientations are assumed unknown. We propose a simple low-complexity subspace clustering algorithm, which applies spectral clustering to an adjacency matrix obtained by thresholding the correlations between data points. In other words, the adjacency matrix is constructed from the nearest neighbors of each data point in spherical distance. A statistical performance analysis shows that the algorithm exhibits robustness to additive noise and succeeds even when the subspaces intersect. Specifically, our results reveal an explicit tradeoff between the affinity of the subspaces and the tolerable noise level. We furthermore prove that the algorithm succeeds even when the data points are incompletely observed with the number of missing entries allowed to be (up to a log-factor) linear in the ambient dimension. We also propose a simple scheme that provably detects outliers, and we present numerical results on real and synthetic data.

研究の動機と目的

  • ノイズあり・欠損ありの高次元データを扱える計算効率の良い部分空間クラスタリングアルゴリズムの開発。
  • 加法的ガウスノイズと欠損データ下でのクラスタリング性能に関する理論的保証の提供。
  • 部分空間クラスタリング用に理論的に正しく動作する外れ値検出スキームの設計。
  • クラスタリング性能における部分空間類似度と耐えうるノイズレベルのトレードオフの分析。
  • 部分空間が重複する場合の耐性拡張、従来手法の限界を克服する。

提案手法

  • 球面距離における近隣点を用いて相関をしきい値処理することで、隣接行列を構築する。
  • しきい値処理を施した隣接行列に対してスペクトルクラスタリングを適用し、データ点を部分空間に割り当てる。
  • 決定的である部分空間と、各部分空間と単位球面の交差から確率的にサンプリングする半確率的データモデルを採用する。
  • 集中不等式とガウス尾部バウンドを用いて、データ点間の内積の挙動を分析する。
  • インライアーが正しくクラスタリングされ、外れ値が最大内積の絶対値をしきい値化することで検出される条件を導出する。
  • 対数正規分布のバウンドから導かれるしきい値と最大内積値を比較する二段階の外れ値検出スキームを導入する。

実験結果

リサーチクエスチョン

  • RQ1加法的ガウスノイズ下でも、単純なしきい値処理に基づく手法が、高次元データにおいて理論的に正しいクラスタリング性能を達成できるか?
  • RQ2部分空間類似度とノイズ耐性の間のトレードオフは何か?
  • RQ3各データ点に線形数の欠損エントリがある場合、アルゴリズムは完全に観測されない状況でも耐性を保てるか?
  • RQ4与えられたモデル下で、外れ値は高い確率で正しく検出できるか?
  • RQ5従来の研究とは異なり、部分空間が重複する場合、この手法は効果を発揮するか?

主な発見

  • TSCアルゴリズムは、部分空間類似度と環境次元に依存するしきい値以下のノイズレベルであれば、加法的ガウスノイズ下でも理論的に正しくデータをクラスタリングできる。
  • 各データ点に最大で対数要因の線形数のエントリが欠損していても、欠損パターンにやや緩い仮定の下では、この手法は成功する。
  • 外れ値検出は高い確率で成功し、外れ値とインライアー間の最大内積がインライアー同士の内積から明確に分離されているためである。
  • 部分空間が重複する場合でも、一般の部分空間の方向を考慮した理論的分析により、アルゴリズムの耐性が保たれていることが示された。
  • 理論的バウンドにより、各部分空間に属するインライアー数が増加するにつれて、クラスタリングおよび外れ値検出の成功確率が指数関数的に増加することが示された。
  • 計算効率と理論的性能の間で有利なトレードオフを達成しており、ℓ1に基づく手法(SSC や RSSC)に比べて複雑度が低く、同等の保証を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。