[논문 리뷰] Self-supervised Contrastive Attributed Graph Clustering
이 논문은 근사한 클러스터링 레이블을 사용하여 노드 표현 학습과 클러스터링을 동시에 최적화하는 자기지도 학습 대비 손실을 활용하는 SCAGC라는 자기지도 대비 속성 그래프 클러스터링 방법을 제안한다. 종단 간 프레임워크에서 자기지도 그래프 대비 학습 모듈과 클러스터링 모듈을 통합함으로써, SCAGC는 네 가지 벤치마크 데이터셋에서 최신 기술 수준을 달성하며, NMI 기준 최대 7.7% 향상된 성능을 보이며, 샘플 외 노드 레이블을 직접 예측할 수 있다.
Attributed graph clustering, which learns node representation from node attribute and topological graph for clustering, is a fundamental but challenging task for graph analysis. Recently, methods based on graph contrastive learning (GCL) have obtained impressive clustering performance on this task. Yet, we observe that existing GCL-based methods 1) fail to benefit from imprecise clustering labels; 2) require a post-processing operation to get clustering labels; 3) cannot solve out-of-sample (OOS) problem. To address these issues, we propose a novel attributed graph clustering network, namely Self-supervised Contrastive Attributed Graph Clustering (SCAGC). In SCAGC, by leveraging inaccurate clustering labels, a self-supervised contrastive loss, which aims to maximize the similarities of intra-cluster nodes while minimizing the similarities of inter-cluster nodes, are designed for node representation learning. Meanwhile, a clustering module is built to directly output clustering labels by contrasting the representation of different clusters. Thus, for the OOS nodes, SCAGC can directly calculate their clustering labels. Extensive experimental results on four benchmark datasets have shown that SCAGC consistently outperforms 11 competitive clustering methods.
연구 동기 및 목표
- 기존의 속성 그래프 클러스터링을 위한 그래프 대비 학습 방법의 한계를 해결하기 위해, 즉 근사한 레이블의 낮은 활용도, 후처리에 의존하는 점, 샘플 외 노드를 처리할 수 없는 점을 해결한다.
- 클러스터링 모듈에서 유도된 가짜 레이블을 사용하여 노드 표현 학습과 클러스터링 할당을 동시에 최적화하는 종단 간 프레임워크를 개발한다.
- 통합된 표현과 클러스터링 함수를 학습함으로써, 샘플 외 노드에 대한 클러스터링 레이블을 직접 예측할 수 있도록 한다.
- 노드 표현에 대한 대비 학습과 클러스터 할당에 대한 대비 클러스터링 손실을 모두 활용하여 클러스터링 성능을 향상시킨다.
- 가짜 레이블에 기반한 지도 학습이 그래프 표현 학습을 향상시켜 더 분류력 있고 조밀한 클러스터 구조를 만들어내는지 확인한다.
제안 방법
- SCAGC는 속성 그래프의 다중 뷰를 생성하기 위해 그래프 증강을 활용하여 노드 표현과 클러스터 할당에 대한 대비 학습을 가능하게 한다.
- 클러스터링 모듈은 부드러운 클러스터 할당 확률을 생성하며, 이를 기반으로 클러스터 내 일致를 극대화하고 클러스터 간 일치를 최소화하는 대비 클러스터링 손실을 계산한다.
- 그래프 표현 학습 모듈은 클러스터링 할당(가짜 레이블)을 기반으로 한 자기지도 대비 손실을 사용하여, 동일 클러스터 소속의 노드 표현을 유사하게 만들고, 다른 클러스터 소속의 표현은 분리한다.
- 클러스터링 모듈과 표현 학습 모듈은 상호작용하며 종단 간 방식으로 공동으로 훈련되어 표현과 클러스터 할당이 상호 보완적으로 향상된다.
- 새로운 노드에 대해 재학습 없이도 학습된 클러스터링 함수를 직접 적용함으로써 샘플 외 추론을 지원한다.
- 가짜 레이블 기반의 자기지도 대비 손실은 온도 조정된 대비 목표를 사용하여, 노이즈가 있는 레이블이 존재하더라도 표현 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1근사한 클러스터링 레이블을 사용한 자기지도 대비 학습이 속성 그래프 클러스터링에서 노드 표현 품질을 향상시키는가?
- RQ2클러스터링 모듈과 그래프 표현 학습 모듈을 함께 훈련하면 별도 훈련보다 더 나은 클러스터링 성능을 낼 수 있는가?
- RQ3제안된 프레임워크는 기존 GCL 기반 방법의 핵심 한계를 극복하고 샘플 외 노드에 대한 클러스터링 레이블을 직접 예측할 수 있는가?
- RQ4대비 클러스터링 모듈은 클러스터 할당을 정교화하고 표현의 조밀성을 향상시키는 데 얼마나 효과적인가?
- RQ5정답 레이블이 없는 상황에서 가짜 레이블 지도 학습이 그래프 대비 학습을 얼마나 향상시키는가?
주요 결과
- SCAGC는 네 가지 벤치마크 데이터셋에서 11종의 최신 기술 수준 기준선을 일관되게 능가하며, DBLP 데이터셋에서 NMI 기준으로 가장 가까운 경쟁자인 GCA 대비 최대 7.7% 향상된 성능을 기록했다.
- 절단 분석 결과, 대비 클러스터링 모듈이 성능 향상에 크게 기여하며, ACM 및 DBLP에서 SCAGC w/o CCM의 경우 클러스터링 지표가 상당히 감소함을 확인했다.
- 가짜 레이블을 사용하는 제안된 자기지도 GCRL 손실은 표준 대비 손실보다 더 나은 표현 학습을 이끌어내며, SCAGC w/o SSC가 전체 모델보다 성능이 열 劣하는 것으로 나타났다.
- t-SNE 시각화 결과, 학습 반복이 진행될수록 노드 표현이 더 조밀하고 잘 분리됨을 보이며, 개선된 클러스터 구조 학습을 나타낸다.
- 수렴 분석 결과, SCAGC는 빠르게 수렴하며, 첫 100회 반복 이내 목적 함수 값이 급격히 감소하고, ACM 데이터셋에서 200회 반복 후 클러스터링 지표가 안정화됨을 확인했다.
- 학습된 클러스터링 함수를 직접 적용함으로써 샘플 외 노드를 성공적으로 처리하였으며, 재학습이나 후처리가 필요 없음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.