Skip to main content
QUICK REVIEW

[論文レビュー] Guided Co-training for Large-Scale Multi-View Spectral Clustering

Tyng-Luh Liu|arXiv (Cornell University)|Jul 18, 2017
Face and Expression Recognition参考文献 2被引用数 13
ひとこと要約

本論文は、ランドマークに基づく近似を用いたガイド付き共同学習を用いて計算複雑性を低減する大規模なマルチビュースペクトルクラスタリング手法を提案する。小さなランドマーク点の集合をサンプリングし、情報豊富な拡張ビューを構築することで、データサイズに線形にスケーリングする性能を達成し、5つのベンチマークデータセットで最先端のクラスタリング性能を実現した。

ABSTRACT

In many real-world applications, we have access to multiple views of the data, each of which characterizes the data from a distinct aspect. Several previous algorithms have demonstrated that one can achieve better clustering accuracy by integrating information from all views appropriately than using only an individual view. Owing to the effectiveness of spectral clustering, many multi-view clustering methods are based on it. Unfortunately, they have limited applicability to large-scale data due to the high computational complexity of spectral clustering. In this work, we propose a novel multi-view spectral clustering method for large-scale data. Our approach is structured under the guided co-training scheme to fuse distinct views, and uses the sampling technique to accelerate spectral clustering. More specifically, we first select $p$ ($\ll n$) landmark points and then approximate the eigen-decomposition accordingly. The augmented view, which is essential to guided co-training process, can then be quickly determined by our method. The proposed algorithm scales linearly with the number of given data. Extensive experiments have been performed and the results support the advantage of our method for handling the large-scale multi-view situation.

研究の動機と目的

  • 大規模なマルチビューデータ環境におけるスペクトルクラスタリングの高い計算複雑性に対処すること。
  • スケーラビリティを向上させるために、ガイド付き共同学習フレームワークをマルチビュースペクトルクラスタリングに拡張すること。
  • 時間計算量を低減しつつクラスタリングの正確性を維持する効率的な近似手法を開発すること。
  • ランドマーク点を用いて、複数のビュー間での共同学習をガイドする情報豊富な拡張ビューを構築すること。
  • 既存の大規模マルチビュークラスタリング手法を上回りつつ、データサイズに対して線形にスケーリングすること。

提案手法

  • 全ビューに共通するランドマーク点 p 個(p ≪ n)を全データセットからサンプリングし、類似度行列の次元を低減する。
  • ランドマーク点に基づいて、Nystroemに類似した近似を用いてラプラシアン行列の固有値分解を計算し、高速なスペクトルクラスタリングを実現する。
  • 全ビューからの情報利得を最大化する新しい基準を用いて、共同学習プロセスをガイドする情報豊富な拡張ビューを構築する。
  • アルゴリズムは、拡張ビューを用いて各ビューの類似度行列を反復的に更新し、複数のビュー間での一貫性を促進する。
  • 最終的なクラスタリングは、拡張ビューから導出された一貫性のある類似度行列に基づいて実行され、安定性と正確性が保証される。
  • データポイントとランドマーク間の近隣関係に基づくスパース表現行列を用いることで、メモリと計算コストを削減する。

実験結果

リサーチクエスチョン

  • RQ1ガイド付き共同学習は、計算コストを低減しつつ、大規模なマルチビュースペクトルクラスタリングに効果的に拡張可能か?
  • RQ2ランドマークに基づく近似は、データサイズに線形にスケーリングしつつ、クラスタリングの正確性を維持できるか?
  • RQ3複数のビュー全体でクラスタリング性能を向上させるために、最適な情報豊富な拡張ビューを構築する方法は何か?
  • RQ4本手法は、既存の大規模マルチビュークラスタリング手法と比較して、正確性と効率性の面で優れているか?
  • RQ5ランドマーク点の数がクラスタリングの性能と安定性にどの程度影響を与えるか?

主な発見

  • 提案手法は5つのベンチマークデータセットで最先端の性能を達成し、MVSC-B や連結 LSC を含む既存手法を上回った。
  • Reuters データセットでは、正解率 0.508、NMI 0.337 を達成し、MVSC-B(正解率 0.502、NMI 0.335)を上回った。
  • MNIST では、正解率 0.754、NMI 0.753 を達成し、MVSC-B(正解率 0.740、NMI 0.708)を上回った。
  • USPS では、正解率 0.738、NMI 0.772 を達成し、MVSC-B(正解率 0.726、NMI 0.765)を上回った。
  • ランドマーク点の数を増やすことで性能が向上するが、分散は低く、中程度のランドマーク集合サイズに対してもロバストであることが示された。
  • 本手法はデータサイズに対して線形にスケーリングするため、標準的なスペクトルクラスタリングが非効率となる大規模応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。