Skip to main content
QUICK REVIEW

[논문 리뷰] Nearly-Linear Time Spectral Graph Reduction for Scalable Graph Partitioning and Data Visualization

Zhiqiang Zhao, Yongyu Wang|arXiv (Cornell University)|2018. 12. 21.
Image and Video Quality Assessment참고 문헌 32인용 수 10
한 줄 요약

이 논문은 스펙트럼 보존 노드 집합 및 제약 조건이 붙은 확률적 경사 하강법을 통한 반복적 스펙트럼 희박화를 통해 큰 무방향 그래프의 핵심 스펙트럼 성질을 유지하는 거의 선형 시간 스펙트럼 그래프 압축 프레임워크를 제안한다. 이 방법은 coPapersCiteseer(0.43M 노드, 16M 간선)와 같은 그래프를 약 16초 만에 13K 노드와 17K 간선으로 압축하며, 스펙트럼 분할에 대해 최대 1100X의 속도 향상과 t-SNE 시각화에 대해 60X의 속도 향상을 이끌어내면서도 높은 해법 품질을 유지한다.

ABSTRACT

This paper proposes a scalable algorithmic framework for spectral reduction of large undirected graphs. The proposed method allows computing much smaller graphs while preserving the key spectral (structural) properties of the original graph. Our framework is built upon the following two key components: a spectrum-preserving node aggregation (reduction) scheme, as well as a spectral graph sparsification framework with iterative edge weight scaling. We show that the resulting spectrally-reduced graphs can robustly preserve the first few nontrivial eigenvalues and eigenvectors of the original graph Laplacian. In addition, the spectral graph reduction method has been leveraged to develop much faster algorithms for multilevel spectral graph partitioning as well as t-distributed Stochastic Neighbor Embedding (t-SNE) of large data sets. We conducted extensive experiments using a variety of large graphs and data sets, and obtained very promising results. For instance, we are able to reduce the "coPapersCiteseer" graph with 0.43 million nodes and 16 million edges to a much smaller graph with only 13K (32X fewer) nodes and 17K (950X fewer) edges in about 16 seconds; the spectrally-reduced graphs also allow us to achieve up to 1100X speedup for spectral graph partitioning and up to 60X speedup for t-SNE visualization of large data sets.

연구 동기 및 목표

  • 원래 그래프 라플라시안의 첫 번째 몇 개인자이지 않은 고유값과 고유벡터를 유지하면서, 대규모 무방향 그래프에 대한 확장 가능한 거의 선형 시간 알고리즘을 개발하는 것.
  • 노드 수와 간선 수를 크게 줄임으로써 수치적 및 그래프 알고리즘의 속도를 높이되, 스펙트럼 충실도를 유지하는 것.
  • 스펙트럼 그래프 분할 및 t-분포 확률적 이웃 임베딩(t-SNE)의 가속화를 위해 스펙트럼 압축을 다단계 프레임워크에 통합하는 것.
  • 반복적 간선 가중치 조정을 위한 새로운 제약 조건이 붙은 확률적 경사 하강법 최적화 접근법을 통해 높은 성능과 해법 품질을 달성하는 것.
  • 실세계 대규모 그래프 및 데이터 세트에서 스펙트럼으로 압축된 그래프의 효과성을 입증하여, 정확도 손실 없이 상당한 속도 향상을 보여주는 것.

제안 방법

  • 유사한 노드를 병합함으로써 스펙트럼 구조를 유지하면서 그래프를 군집화하는 스펙트럼 보존 노드 집합 기법을 사용한다.
  • 압축된 그래프의 희박성과 스펙트럼 충실도를 유지하기 위해 반복적 간선 가중치 조정을 적용하는 스펙트럼 그래프 희박화 프레임워크를 적용한다.
  • 스펙트럼 보존을 보장하기 위해 라플라시안 고유벡터의 강건한 유지 보장을 위해 반복적 간선 가중치 조정 동안 간선 가중치를 정밀 조정하기 위해 새로운 제약 조건이 붙은 확률적 경사 하강법(SGD) 최적화 방법을 사용한다.
  • 거의 선형 시간 복잡도를 달성하기 위해 유사도 인식 스펙트럼 희박화와 그래프 이론적 대체 다중격자(AMG) 라플라시안 해법기를 활용한다.
  • 스펙트럼으로 압축된 그래프에서 계산된 고유벡터 및 기타 해법의 품질을 향상시키기 위해 정밀 조정 절차를 도입한다.
  • 대규모 데이터 세트에서의 계산을 가속화하기 위해 스펙트럼 그래프 분할 및 t-SNE에 대한 다단계 알고리즘에 프레임워크를 통합한다.

실험 결과

연구 질문

  • RQ1거의 선형 시간 알고리즘이 그래프 압축 과정에서 원래 그래프 라플라시안의 첫 번째 몇 개인자이지 않은 고유값과 고유벡터를 유지할 수 있는가?
  • RQ2스펙트럼 충실도를 유지하면서 스펙트럼 그래프 압축이 그래프 크기(노드 수와 간선 수)를 얼마나 줄일 수 있는가?
  • RQ3제안된 프레임워크는 대규모 그래프 및 데이터 세트에서 다단계 스펙트럼 그래프 분할 및 t-SNE 시각화의 가속화에 얼마나 효과적인가?
  • RQ4고유벡터의 고차원 항목(예: 10번째)을 포함할 경우 t-SNE 임베딩 벡터와의 상관관계에 어떤 영향을 미치는가?
  • RQ5스펙트럼으로 압축된 그래프는 실세계 그래프 및 데이터 분석 워크로드에서 높은 속도 향상과 높은 품질의 해법을 동시에 달성할 수 있는가?

주요 결과

  • coPapersCiteseer 그래프(0.43M 노드, 16M 간선)는 약 16초 만에 13K 노드와 17K 간선으로 압축되었으며, 노드 수는 32배, 간선 수는 950배 감소하였다.
  • 압축된 그래프를 사용한 스펙트럼 그래프 분할은 원본 그래프 대비 최대 1100X의 속도 향상을 달성했으며, 더 큰 분할 수에 대해 METIS보다 일관되게 높은 분할 품질을 보였다.
  • 스펙트럼으로 압축된 그래프를 사용한 t-SNE 시각화에서는 최대 60X의 속도 향상을 달성했고, 명확한 클러스터 경계와 고품질 임베딩을 유지했다.
  • t-SNE 임베딩 벡터와 첫 번째 몇 개인자이지 않은 라플라시안 고유벡터 사이에 강한 상관관계(최대 0.95)가 관찰되었으며, 특히 USPS 및 MNIST 데이터 세트에서 진짜 클러스터 수(10개)와 일치하는 10번째 고유벡터를 포함할 경우 더욱 뚜렷했다.
  • 모든 실험에서 스펙트럼으로 압축된 그래프는 극적인 크기 감소에도 불구하고 높은 해법 품질을 유지했으며, 정확도 손실는 최소한이었다.
  • 제안된 제약 조건이 붙은 SGD 최적화 및 반복적 스케일링 프레임워크는 강건한 스펙트럼 보존과 확장성을 가능하게 하여 거의 선형 시간 복잡도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.