Skip to main content
QUICK REVIEW

[論文レビュー] Large-Scale Subspace Clustering via k-Factorization

Jicong Fan|arXiv (Cornell University)|Dec 8, 2020
Face and Expression Recognition参考文献 39被引用数 5
ひとこと要約

本稿では、構造的スパarsityを用いて、アフィニティ行列の構築とスペクトルクラスタリングを回避する線形時間計算量の手法、k-要因分解部分空間クラスタリング(k-FSC)を提案する。k-FSCは、大規模でノイズが多い、ストリーミングデータに対しても最先端の精度と効率性を達成しており、オンラインおよびアウトオブサンプルクラスタリングをサポートする拡張も可能である。

ABSTRACT

Subspace clustering (SC) aims to cluster data lying in a union of low-dimensional subspaces. Usually, SC learns an affinity matrix and then performs spectral clustering. Both steps suffer from high time and space complexity, which leads to difficulty in clustering large datasets. This paper presents a method called k-Factorization Subspace Clustering (k-FSC) for large-scale subspace clustering. K-FSC directly factorizes the data into k groups via pursuing structured sparsity in the matrix factorization model. Thus, k-FSC avoids learning affinity matrix and performing eigenvalue decomposition, and has low (linear) time and space complexity on large datasets. This paper proves the effectiveness of the k-FSC model theoretically. An efficient algorithm with convergence guarantee is proposed to solve the optimization of k-FSC. In addition, k-FSC is able to handle sparse noise, outliers, and missing data, which are pervasive in real applications. This paper also provides online extension and out-of-sample extension for k-FSC to handle streaming data and cluster arbitrarily large datasets. Extensive experiments on large-scale real datasets show that k-FSC and its extensions outperform state-of-the-art methods of subspace clustering.

研究の動機と目的

  • アフィニティ行列の計算とスペクトルクラスタリングに依存する従来の部分空間クラスタリング手法が直面する高コストな時間的・空間的計算量を解消すること。
  • 大規模データセットの有効なクラスタリングを実現するため、大きなアフィニティ行列の保存・計算の必要性を排除すること。
  • 実世界の応用で一般的なスパースノイズ、外れ値、欠損データ、ストリーミングデータを処理できる手法の開発。
  • 非凸で滑らかでないk-FSCモデルに対する理論的保証と効率的な最適化手法の開発。
  • 任意に大きなまたは動的に変化するデータセットに対応できるオンラインおよびアウトオブサンプル設定へのk-FSCの拡張。

提案手法

  • データをk個のクラスタ(k個の部分空間に対応)に直接要因分解するグループスパース行列因子分解モデルを提案し、アフィニティ行列の構築を回避する。
  • グループワイドなクラスタリングを強制するために因子分解に構造的スパarsityを導入し、低ランクかつグループスパースな解を最適化ターゲットとする。
  • 非凸で滑らかでない最適化問題を解くために、収束保証付きの効率的な交替方向乗数法(ADMM)アルゴリズムを用いる。
  • 大規模データセットへのスケーリングを実現するために、k-FSC-MB(ミニバッチ)およびk-FSC-L(オンライン)の変種を導入し、バッチ処理または逐次処理でデータを処理する。
  • スパースノイズ、外れ値、欠損データの処理を可能にするために、L1ノルム正則化を組み込むことでk-FSCをロバストクラスタリングに拡張。
  • 学習済みの因子分解を用いて新しいデータポイントをクラスタに割り当てる写像を学習することで、アウトオブサンプル拡張を実現。

実験結果

リサーチクエスチョン

  • RQ1構造的スパarsityを用いた直接的行列因子分解アプローチは、線形時間・空間計算量を維持しながら、最先端の部分空間クラスタリング精度を達成できるか?
  • RQ2従来のスペクトルクラスタリング手法が計算コストの高さにより失敗する大規模データセットにおいて、k-FSCはどのように性能を発揮するか?
  • RQ3事前処理を施さずに、スパースノイズ、外れ値、欠損データといった実世界のデータ課題を効果的に処理できるか?
  • RQ4k-FSCのオンラインおよびアウトオブサンプル拡張は、ストリーミングおよび任意に大きなデータ環境でどのように性能を発揮するか?
  • RQ5k-FSCモデルが真の部分空間構造を回復する有効性の理論的根拠は何か?

主な発見

  • EpilepticおよびPosturesデータセットにおいて、k-FSCはS5CやS3COMP-Cですら上回る最高の正確度(ACC)と正規化相互情報量(NMI)を達成した。
  • CovtypeおよびPokerHandデータセットでは、k-FSCはCovtypeで43.95%のACCおよび5.59%のNMI、PokerHandで21.82%のACCを達成し、SSSCやLSC-Kを含むすべてのベースラインを顕著に上回った。
  • Posturesデータセットにおいて、k-FSC-MBとk-FSC-Lは、それぞれ9.1秒および5.9秒のトレーニング時間で、k-FSCの173.9秒およびS3COMP-Cの755.3秒を大幅に下回りながらも、競争力ある正確度を維持した。
  • k-FSCのオンラインおよびアウトオブサンプル拡張により、メモリに収まらないほどの大規模データセットの有効なクラスタリングが可能となり、従来手法を凌駕するスケーラビリティを示した。
  • k-FSCはスパースノイズおよび欠損データに対してロバストであり、腐敗度が異なる多数の実世界データセットにおいても性能が維持された。
  • 提案されたアルゴリズムは実際の応用において信頼性高く収束し、最適化手順に対して理論的収束保証が確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。