Skip to main content
QUICK REVIEW

[논문 리뷰] Guided Co-training for Large-Scale Multi-View Spectral Clustering

Tyng-Luh Liu|arXiv (Cornell University)|2017. 07. 18.
Face and Expression Recognition참고 문헌 2인용 수 13
한 줄 요약

이 논문은 계산 복잡도를 줄이기 위해 지도형 공훈련과 기반점 기반 근사법을 사용하는 대규모 다중 시각 스펙트럼 클러스터링 방법을 제안한다. 소량의 기반점 집합을 샘플링하고 정보가 풍부한 보강된 시각을 구성함으로써, 데이터 크기에 대해 선형 확장성을 보이며 다섯 가지 벤치마크 데이터셋에서 최신 기술 수준의 클러스터링 성능을 달성한다.

ABSTRACT

In many real-world applications, we have access to multiple views of the data, each of which characterizes the data from a distinct aspect. Several previous algorithms have demonstrated that one can achieve better clustering accuracy by integrating information from all views appropriately than using only an individual view. Owing to the effectiveness of spectral clustering, many multi-view clustering methods are based on it. Unfortunately, they have limited applicability to large-scale data due to the high computational complexity of spectral clustering. In this work, we propose a novel multi-view spectral clustering method for large-scale data. Our approach is structured under the guided co-training scheme to fuse distinct views, and uses the sampling technique to accelerate spectral clustering. More specifically, we first select $p$ ($\ll n$) landmark points and then approximate the eigen-decomposition accordingly. The augmented view, which is essential to guided co-training process, can then be quickly determined by our method. The proposed algorithm scales linearly with the number of given data. Extensive experiments have been performed and the results support the advantage of our method for handling the large-scale multi-view situation.

연구 동기 및 목표

  • 대규모 다중 시각 데이터 환경에서 스펙트럼 클러스터링의 높은 계산 복잡도를 해결하기 위해.
  • 확장성을 확보하기 위해 지도형 공훈련 프레임워크를 다중 시각 스펙트럼 클러스터링으로 확장하기 위해.
  • 시간 복잡도를 감소시키면서도 클러스터링 정확도를 유지하는 효율적인 근사 방법을 개발하기 위해.
  • 다양한 시각 간의 공훈련을 이끄는 기반점으로부터 정보가 풍부한 보강된 시각을 구성하기 위해.
  • 기존의 대규모 다중 시각 클러스터링 방법보다 우수하면서도 데이터 크기에 대해 선형 확장성을 확보하기 위해.

제안 방법

  • 모든 시각에 공통되는 전체 데이터셋에서 p개의 기반점(p ≪ n)을 샘플링하여 유사도 행렬의 차원을 축소한다.
  • 기반점 기반의 Nyström 유사 근사법을 사용하여 라플라시안 행렬의 고유분해를 계산함으로써 빠른 스펙트럼 클러스터링을 가능하게 한다.
  • 모든 시각의 정보 수익을 최대화하는 새로운 기준을 사용하여 보다 정보가 풍부한 보강된 시각을 구성함으로써 공훈련 과정을 이끈다.
  • 보강된 시각을 사용하여 각 시각의 유사도 행렬을 반복적으로 갱신함으로써 시각 간의 일치를 증진시킨다.
  • 최종적으로 보강된 시각에서 유도된 공통 유사도 행렬에 기반하여 클러스터링을 수행함으로써 안정성과 정확도를 보장한다.
  • 데이터 포인트와 기반점 간의 근접 이웃 관계로부터 유도된 희소 표현 행렬을 활용하여 메모리 및 계산 비용을 감소시킨다.

실험 결과

연구 질문

  • RQ1지도형 공훈련이 계산 비용을 줄이면서도 대규모 다중 시각 스펙트럼 클러스터링에 효과적으로 확장될 수 있는가?
  • RQ2기반점 기반 근사법이 데이터 크기에 대해 선형 확장되면서도 클러스터링 정확도를 유지할 수 있는가?
  • RQ3다양한 시각에서 클러스터링 성능을 향상시키기 위해 정보가 풍부한 보강된 시각을 구성하는 최적의 방법은 무엇인가?
  • RQ4기존의 대규모 다중 시각 클러스터링 접근법과 비교할 때, 제안된 방법의 정확도 및 효율성은 어떠한가?
  • RQ5기반점의 수가 클러스터링 성능와 안정성에 얼마나 영향을 미치는가?

주요 결과

  • 제안된 방법은 다섯 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, MVSC-B 및 연결된 LSC를 포함한 기존 방법들을 능가한다.
  • Reuters 데이터셋에서, 방법은 정확도 0.508과 NMI 0.337을 기록하여 MVSC-B(정확도 0.502, NMI 0.335)를 능가한다.
  • MNIST에서 방법은 정확도 0.754와 NMI 0.753을 달성하여 MVSC-B(정확도 0.740, NMI 0.708)를 초월한다.
  • USPS에서 방법은 정확도 0.738과 NMI 0.772를 기록하여 MVSC-B(정확도 0.726, NMI 0.765)를 능가한다.
  • 기반점의 수가 많아질수록 성능이 향상되지만 분산은 낮아져 중간 크기의 기반점 집합에서도 강건함을 보인다.
  • 방법은 데이터 크기에 대해 선형 확장성을 보이며, 기존 스펙트럼 클러스터링이 비가능한 대규모 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.