Skip to main content
QUICK REVIEW

[논문 리뷰] SCGC : Self-Supervised Contrastive Graph Clustering

Gayan K. Kulatilleke, Marius Portmann|arXiv (Cornell University)|2022. 04. 27.
Advanced Graph Neural Networks인용 수 14
한 줄 요약

SCGC는 기존 GNN을 간단한 오토에인코더와 대비 손실로 대체하여 그래프 구조를 강제함으로써 인접 행렬과 고비용 연산에 의존하지 않는 자기지도 대비 그래프 클러스터링 방법을 제안한다. SCGC*는 影響-증강 대비 손실(IAC 손실)을 사용하여 효율성과 강건성을 더욱 향상시켜, 최신 기술 대비 훈련 속도 55% 향상, 추론 속도 81% 향상 달성과 동시에 DBLP에서 Adjusted Rand Index(Ari) 20% 향상, NMI 18% 향상 달성.

ABSTRACT

Graph clustering discovers groups or communities within networks. Deep learning methods such as autoencoders (AE) extract effective clustering and downstream representations but cannot incorporate rich structural information. While Graph Neural Networks (GNN) have shown great success in encoding graph structure, typical GNNs based on convolution or attention variants suffer from over-smoothing, noise, heterophily, are computationally expensive and typically require the complete graph being present. Instead, we propose Self-Supervised Contrastive Graph Clustering (SCGC), which imposes graph-structure via contrastive loss signals to learn discriminative node representations and iteratively refined soft cluster labels. We also propose SCGC*, with a more effective, novel, Influence Augmented Contrastive (IAC) loss to fuse richer structural information, and half the original model parameters. SCGC(*) is faster with simple linear units, completely eliminate convolutions and attention of traditional GNNs, yet efficiently incorporates structure. It is impervious to layer depth and robust to over-smoothing, incorrect edges and heterophily. It is scalable by batching, a limitation in many prior GNN models, and trivially parallelizable. We obtain significant improvements over state-of-the-art on a wide range of benchmark graph datasets, including images, sensor data, text, and citation networks efficiently. Specifically, 20% on ARI and 18% on NMI for DBLP; overall 55% reduction in training time and overall, 81% reduction on inference time. Our code is available at : https://github.com/gayanku/SCGC

연구 동기 및 목표

  • GNN 기반 그래프 클러스터링에서의 과도한 스무딩, 노이즈 민감도, 계산 비효율성 문제를 해결하기 위해.
  • 그래프 구조를 유지하기 위해 오토에인코더 임베딩에 대비 학습을 적용함으로써 인접 행렬과 GNN 연산의 필요성을 제거하기 위해.
  • 자기지도 소프트 클러스터링을 통해 이질성, 노이즈 엣지, 레이블 노이즈에 대한 강건성을 향상시키기 위해.
  • 자원 제약 환경에서 배치 처리, 병렬 처리, 확장성을 가능하게 하기 위해.
  • 다양한 그래프 모odal리티에 적용 가능한 경량, 효율적이고 일반화 가능한 클러스터링 프레임워크를 개발하기 위해.

제안 방법

  • 그래프 컬러션 또는 어텐션 메커니즘을 사용하지 않고도 노드 표현을 학습하기 위해 단순한 다층 퍼셉트론(MLP) 오토에인코더를 사용한다.
  • 최종 임베딩 레이어에 대비 손실을 적용하여 그래프 구조를 강제함으로써 공통된 이웃 영향을 가진 노드 간 유사성을 증진시킨다.
  • SCGC*에서 도입된 영향-증강 대비(IAC) 손실은 다중 순서 이웃 영향을 집계하여 더 강력한 인도크티브 바이어스를 제공한다.
  • 임베딩 공간의 신뢰도 점수를 사용하여 반복적으로 클러스터 할당을 개선하는 자기지도 소프트 클러스터링 헤드를 활용한다.
  • 모델 아키텍처를 그래프 구조에서 분리함으로써 인접 행렬 의존 없이 간단한 병렬 처리 및 배치 처리가 가능해진다.
  • 인접 행렬이 필요 없는 선형 시간 추론 프로세스를 사용하여 엣지 디바이스에 빠른 구현이 가능하다.

실험 결과

연구 질문

  • RQ1모델에서 GNN이나 인접 정보를 사용하지 않고도 그래프 클러스터링을 효과적으로 수행할 수 있는가?
  • RQ2오토에인코더 기반 클러스터링에서 대비 학습을 어떻게 활용하여 구조적 인도크티브 바이어스를 강제할 수 있는가?
  • RQ3경량, 비-GNN 모델이 과도한 스무딩, 노이즈, 이질성에 강건하면서도 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4기반 영향 대비 학습이 클러스터링 품질과 훈련 효율성에 미치는 영향은 무엇인가?
  • RQ5모델은 효율적으로 배치 처리 및 병렬 처리가 가능하여 대규모 그래프에 대한 확장성이 보장되는가?

주요 결과

  • SCGC*는 DBLP 인용 네트워크에서 최신 기술 대비 Adjusted Rand Index(Ari) 20% 향상, NMI 18% 향상 달성.
  • 다양한 데이터셋에서 두 번째로 우수한 베이스라인인 AGCN 대비 훈련 시간 55% 단축, 추론 시간 81% 단축.
  • 대비 손실과 소프트 클러스터링 메커니즘 덕분에 과도한 스무딩, 노이즈 엣지, 이질성에 강건하다.
  • SCGC*의 영향-증강 대비(IAC) 손실은 명시적 GNN 레이어 없이도 장거리 의존성을 효과적으로 모델링할 수 있다.
  • 기존의 많은 GNN 기반 모델들과 달리 모델은 완전히 배치 처리 및 간단한 병렬 처리가 가능하다.
  • SCGC의 추론은 인접 행렬이 필요 없어 배치 크기 비례 선형 시간 복잡도를 가지며, 엣지 디바이스에 빠른 배포가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.