[논문 리뷰] Semi-supervised Spectral Clustering for Classification
이 논문은 공통으로 클러스터링된 학습 및 테스트 데이터로부터 클래스-클러스터 분포를 학습하여 이미지셋 분류 성능을 향상시키기 위해 준감독 스펙트럴 클러스터링을 활용하는 새로운 분류를 위한 클러스터링(CVC) 프레임워크를 제안한다. 직접 페일러 벡터 계산(DFVC) 알고리즘과 그라스만만 곡면 표현을 사용함으로써, 다섯 개의 표준 데이터셋에서 최신 기술을 능가하는 정확도를 달성하면서도 기존 방법들보다 훨씬 빠른 속도를 구현한다.
We propose a Classification Via Clustering (CVC) algorithm which enables existing clustering methods to be efficiently employed in classification problems. In CVC, training and test data are co-clustered and class-cluster distributions are used to find the label of the test data. To determine an efficient number of clusters, a Semi-supervised Hierarchical Clustering (SHC) algorithm is proposed. Clusters are obtained by hierarchically applying two-way NCut by using signs of the Fiedler vector of the normalized graph Laplacian. To this end, a Direct Fiedler Vector Computation algorithm is proposed. The graph cut is based on the data structure and does not consider labels. Labels are used only to define the stopping criterion for graph cut. We propose clustering to be performed on the Grassmannian manifolds facilitating the formation of spectral ensembles. The proposed algorithm outperformed state-of-the-art image-set classification algorithms on five standard datasets.
연구 동기 및 목표
- 비감독 클러스터링과 감독 분류 사이의 격차를 메우기 위해, 클러스터가 종종 클래스 경계를 가로질러야 하는 상황을 고려한다.
- 유일한 클래스-클러스터 대응 관계가 필요 없이 클러스터링 결과를 활용하는 일반적인 분류 프레임워크를 개발한다.
- 목표 함수에 강제로 클래스 경계를 반영하지 않고도 클래스 경계를 존중하는 방식으로 최적의 클러스터 수를 준감독적으로 결정한다.
- 새로운 고유값 해법을 사용해 스펙트럴 클러스터링에서 페일러 벡터를 전적으로 계산하지 않고도 직접 계산함으로써 스펙트럴 클러스터링의 속도를 향상시킨다.
- 이미지셋 분류 작업에서 이상치에 대한 강건성과 확장성 향상을 도모한다.
제안 방법
- CVC는 정규화된 그래프 컷 기반의 준감독 계층적 클러스터링(SHC) 알고리즘을 사용하여 학습 및 테스트 데이터를 동시 클러스터링한다.
- SHC는 정규화된 그래프 라플라시안의 페일러 벡터의 부호를 사용해 클러스터를 반복적으로 분할하며, 레이블은 오직 프로세스 종료 조건으로만 사용된다.
- 직접 페일러 벡터 계산(DFVC) 알고리즘을 제안하며, 이는 이동된 역행 반복법을 사용해 두 번째로 작은 고유벡터를 효율적으로 계산한다.
- 다양한 곡면 표현 간의 스펙트럴 앙상블 학습을 가능하게 하기 위해 데이터를 그라스만만 곡면으로 매핑한다.
- 클러스터 기반의 확률 분포 간의 거리 측도를 사용해 분류를 수행한다.
- 다양한 차원의 곡면에서 유도된 다수의 분류기를 융합하기 위해 모드 융합 기법을 적용하여 조기 종료 및 속도 향상을 달성한다.
실험 결과
연구 질문
- RQ1클러스터가 본질적으로 여러 클래스를 포함하고 있을 경우, 분류에 효과적으로 클러스터링을 활용할 수 있는가?
- RQ2목표 함수에 강제로 경계를 반영하지 않고도 클래스 경계를 존중하는 방식으로 최적의 클러스터 수를 결정할 수 있는가?
- RQ3모든 고유벡터를 계산하지 않고도, 특히 분할에 필요한 부호만 필요할 경우 페일러 벡터를 효율적으로 계산할 수 있는가?
- RQ4학습 및 테스트 데이터를 동시에 클러스터링하는 것이 국소 분류 방법보다 더 우수한 일반화 성능을 보이는가?
- RQ5이러한 방법이 이미지셋 분류 과제에서 이상치 및 노이즈가 많은 샘플에 대해 얼마나 강건한가?
주요 결과
- SHC와 DFVC를 결합한 제안된 CVC 알고리즘은 다섯 개의 표준 데이터셋에서 모두 7개의 최신 기술 이미지셋 분류 알고리즘을 능가했다.
- Honda 데이터셋에서 갤러리 세트에 19%, 38%, 57%의 이상치가 존재할 경우, CVC 알고리즘은 100%의 인식 정확도를 달성했다.
- 프로브 세트에 1~3장의 이상치 이미지가 포함된 경우, CVC 알고리즘은 각각 100%, 100%, 97.43%의 인식률을 기록했다.
- SHC 알고리즘은 k-means, SSC, SKMS보다 평균적으로 각각 1.33배, 3.38배, 16.47배 빠르며, 최대 속도 향상은 각각 3.77배, 7.03배, 47.0배였다.
- DFVC 알고리즘이 저비용 컷이 존재할 경우에 매우 빠르게 수렴하여 유리한 경우에 계산 비용을 크게 감소시켰다.
- 모드 융합을 통해 저차원 분류기의 다수 의견이 일치할 경우 조기 종료가 가능해져 정확도를 훼손하지 않고도 분류 속도를 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.