[논문 리뷰] Align then Fusion: Generalized Large-scale Multi-view Clustering with Anchor Matching Correspondences
FMVACC는 유연한 앵커 집합을 학습하고, 특징과 구조 정보를 모두 사용하여 뷰 간에 이를 정렬하며, 정렬된 앵커 그래프를 융합해 대규모 다중 뷰 클러스터링의 성능을 향상시키는 일반화되고 확장 가능한 프레임워크를 제시한다.
Multi-view anchor graph clustering selects representative anchors to avoid full pair-wise similarities and therefore reduce the complexity of graph methods. Although widely applied in large-scale applications, existing approaches do not pay sufficient attention to establishing correct correspondences between the anchor sets across views. To be specific, anchor graphs obtained from different views are not aligned column-wisely. Such an extbf{A}nchor- extbf{U}naligned extbf{P}roblem (AUP) would cause inaccurate graph fusion and degrade the clustering performance. Under multi-view scenarios, generating correct correspondences could be extremely difficult since anchors are not consistent in feature dimensions. To solve this challenging issue, we propose the first study of the generalized and flexible anchor graph fusion framework termed extbf{F}ast extbf{M}ulti- extbf{V}iew extbf{A}nchor- extbf{C}orrespondence extbf{C}lustering (FMVACC). Specifically, we show how to find anchor correspondence with both feature and structure information, after which anchor graph fusion is performed column-wisely. Moreover, we theoretically show the connection between FMVACC and existing multi-view late fusion \cite{liu2018late} and partial view-aligned clustering \cite{huang2020partially}, which further demonstrates our generality. Extensive experiments on seven benchmark datasets demonstrate the effectiveness and efficiency of our proposed method. Moreover, the proposed alignment module also shows significant performance improvement applying to existing multi-view anchor graph competitors indicating the importance of anchor alignment. Our code is available at \url{https://github.com/wangsiwei2010/NeurIPS22-FMVACC}.
연구 동기 및 목표
- 대규모 다중 뷰 클러스터링에서 앵커 불일치 문제(AUP)를 식별하고 해결한다.
- 다른 특징 차원을 가진 뷰에서도 작동하는 유연한 앵커 생성 및 정렬 메커니즘을 개발한다.
- 뷰 간 앵커 매칭 후 앵커 그래프의 열 방향 융합을 가능하게 한다.
- FMVACC를 기존의 후합(late fusion) 및 PVC 접근법에 이론적으로 관련지어 일반성을 입증한다.
- 여러 대규모 데이터셋에서 효율성과 효과를 입증하고 정렬 모듈이 기존 방법에 도움이 됨을 보인다.
제안 방법
- 앵커 판별성을 개선하기 위해 A_i A_i^T = I_m 이 되도록 Z_i와 A_i를 함께 최적화하여 유연한 단일 뷰 앵커를 생성한다.
- Z_i를 각 행에 대해 비음수성과 합이 1인 단순형으로의 투영을 통해 반복적으로 업데이트하고, B = Z_i^T X_i를 만족하는 경우 트렁크된 SVD를 이용해 A_i를 업데이트한다.
- 각 앵커를 Z_i의 해당 열로 표현하여 앵커 정렬을 n차원 공간의 그래프 매칭 문제로 변환한다.
- 할당 제약 하에서 Z_1^T Z_2를 최대화하여 특징 대응을 형성한다(동등하게 운송/할당 문제를 푼다).
- S_1 = Z_1^T Z_1 and S_2 = Z_2^T Z_2를 이용해 내부 그래프 구조를 맞춰 구조 대응을 형성하고, ||S_1 - P^T S_2 P||_F^2를 최소화한다.
- 특징 및 구조 신호를 하나의 통합 이차 할당 문제로 결합해 앵커를 정렬하는 순열 P를 얻고(프로젝티드 고정점 알고리즘으로 해결).
- 정렬된 앵커 그래프를 융합해 Z_Aligned를 만들고 임베딩에서 순위-k SVD를 적용한 뒤 k-means로 클러스터링을 얻는다.
실험 결과
연구 질문
- RQ1다른 특징 공간을 가진 다중 뷰 데이터에서 유연한 앵커 세트를 효과적으로 정렬하는 방법은?
- RQ2특징 유사성과 그래프 구조를 모두 바탕으로 한 앵커 정렬이 대규모 MVC에서 융합 및 클러스터링 성능을 향상시킬 수 있는가?
- RQ3FMVACC와 기존의 후합(late fusion) 및 PVC 접근법 간의 이론적 관계는 무엇인가?
- RQ4제안된 FMVACC의 계산 및 메모리 요구 사항은 무엇이며 매우 큰 데이터셋에도 확장 가능한가?
주요 결과
- FMVACC는 일차(특징) 및 이차(구조) 대응을 함께 고려하여 효과적인 앵커 정렬을 달성한다.
- 제안된 정렬 모듈은 기존 MVC 방법(예: LMVSC)에 적용 시 클러스터링을 현저히 향상시키고 잡음을 줄이며 융합 품질을 높인다.
- 유연한 앵커 선택과 정렬은 시뮬레이션 데이터와 실제 벤치마크에서 고정 인덱스 방식(SFMC 등)보다 우수하다.
- FMVACC는 n에 대해 선형 시간 및 공간 복잡도를 보여 대규모 데이터셋에 적합하며, 정렬 후의 SVD 및 k-means를 통한 클러스터링도 여전히 효율적이다.
- 정렬 구성요소는 MNIST 및 YTF 변형 등과 같은 대규모를 포함한 일곱 개의 실제 다중 뷰 데이터셋에서 상당한 성능 향상을 제공합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.