Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Agglomerative Graph Clustering in Nearly-Linear Time

Laxman Dhulipala, David Eisenstat|arXiv (Cornell University)|2021. 06. 10.
Complex Network Analysis Techniques인용 수 10
한 줄 요약

이 논문은 간선 가중치가 부여된 그래프에서 계층적 응집 군집화(HAC)를 위한 새로운 알고리즘 프레임워크를 제안한다. 동적 저출력도 그래프 방향성과 모듈식 이웃 힙 데이터 구조를 활용하여 근사 선형 시간 복잡도를 달성한다. 완전 연결 및 WPGMA 연결을 위한 첫 번째 정확한 $\tilde{O}(m)$-시간 알고리즘을 제공하며, 평균 연결을 위한 첫 번째 비제곱 $\tilde{O}(n\bar{\beta})$-시간 정확 알고리즘과 함께 보완적인 $\tilde{O}(m)$-시간 $\epsilon$-근접 근사 알고리즘을 제공하여 대규모 데이터셋에서 최대 76.5배의 속도 향상을 이끌어내면서 군집 품질을 유지한다.

ABSTRACT

We study the widely used hierarchical agglomerative clustering (HAC) algorithm on edge-weighted graphs. We define an algorithmic framework for hierarchical agglomerative graph clustering that provides the first efficient $ ilde{O}(m)$ time exact algorithms for classic linkage measures, such as complete- and WPGMA-linkage, as well as other measures. Furthermore, for average-linkage, arguably the most popular variant of HAC, we provide an algorithm that runs in $ ilde{O}(n\sqrt{m})$ time. For this variant, this is the first exact algorithm that runs in subquadratic time, as long as $m=n^{2-ε}$ for some constant $ε> 0$. We complement this result with a simple $ε$-close approximation algorithm for average-linkage in our framework that runs in $ ilde{O}(m)$ time. As an application of our algorithms, we consider clustering points in a metric space by first using $k$-NN to generate a graph from the point set, and then running our algorithms on the resulting weighted graph. We validate the performance of our algorithms on publicly available datasets, and show that our approach can speed up clustering of point datasets by a factor of 20.7--76.5x.

연구 동기 및 목표

  • 실제 데이터에서 비영인 유사도가 $o(n^2)$개 이하일 때 기존 $O(n^2)$ HAC 알고리즘이 비효율적인 문제를 해결하기 위해.
  • 희박한 간선 가중치가 부여된 그래프에서 효율적이고 정확하며 근사 가능한 HAC를 가능하게 하는 일반적인 알고리즘 프레임워크를 설계하기 위해.
  • 특히 평균 연결을 포함한 널리 사용되는 연결 측정법에 대해 비제곱 또는 거의 선형 시간 복잡도를 달성하기 위해, 이전에 이러한 알고리즘이 없었던 평균 연결을 중심으로 하기 위해.
  • 메트릭 공간 점 집합에서 생성된 $k$-NN 그래프를 사용하여 실제 점 데이터셋에서 제안된 알고리즘의 실용적 확장성과 군집 품질을 검증하기 위해.

제안 방법

  • 프레임워크는 이웃 힙 데이터 구조를 사용하여 핵심 HAC 연산을 모듈화하여 그래프 간선 기반의 효율적 우선순위 큐 연산을 가능하게 한다.
  • 평균 연결을 위한 알고리즘은 그래프의 저출력도 방향성을 동적으로 유지하며, 최대 출력도 $O(\alpha)$를 보장한다. 여기서 $\alpha$는 그래프의 산림성이다.
  • 정확한 알고리즘은 $\tilde{O}(n\bar{\alpha})$ 시간에 실행되며, $\alpha = O(\sqrt{m})$ 이므로 $\tilde{O}(n\sqrt{m})$ 시간에 도달한다.
  • 평균 연결을 위한 근사 알고리즘은 샘플링 기반 접근법을 사용하여 $\epsilon$-근접 연결 값을 유지함으로써 $\tilde{O}(m)$ 시간에 실행된다.
  • 이 방법은 메트릭 공간 점 집합에서 생성된 $k$-NN 그래프에 적용 가능하며, 군집화 워크플로우를 그래프 기반 HAC 워크플로우로 변환한다.
  • 프레임워크는 정의되지 않은 유사도를 완전/와이피지마 연결에 대해 $\bot$로, 평균 연결에 대해 0으로 간주하며, 전체 $n \times n$ 유사도 행렬을 저장하지 않기 위해 간선 가중치 기반 그래프 표현을 사용한다.

실험 결과

연구 질문

  • RQ1비영인 유사도가 $o(n^2)$개 이하일 때, 평균 연결을 위한 정확한 HAC 알고리즘을 비제곱 시간에 실행할 수 있는가?
  • RQ2희박한 그래프 환경에서 완전 및 WPGMA 연결과 같은 고전적 연결 측정법에 대해 거의 선형 시간 복잡도를 달성할 수 있는가?
  • RQ3평균 연결을 위한 근사 HAC 알고리즘을 $\tilde{O}(m)$ 시간에 실행하면서 군집 품질을 유지할 수 있는가?
  • RQ4제안된 프레임워크는 표준 $O(n^2)$ 구현보다 상당한 종합적 속도 향상을 이끌 수 있는 대규모 데이터셋(예: 60,000점 이상)에 확장 가능한가?

주요 결과

  • 정확한 평균 연결 HAC 알고리즘은 $\tilde{O}(n\sqrt{m})$ 시간에 실행되며, $m = n^{2-\epsilon}$일 경우 비제곱 시간이므로, 이 측정법에 대해 첫 번째 정확한 알고리즘이다.
  • 완전 및 WPGMA 연결을 위한 프레임워크는 $\tilde{O}(m)$-시간 정확 알고리즘을 달성하여 기존의 표준 $O(n^2)$ 복잡도보다 크게 향상된다.
  • Fashion-MNIST 데이터셋(60,000점)에서 그래프 기반 접근법은 sklearn의 $O(n^2)$ 유사도 기반 HAC보다 종합적으로 20.7배 빠른 성능을 보였다.
  • Last.fm 데이터셋(292,385점)에서 근사 평균 연결 알고리즘은 76.5배의 속도 향상을 달성했으며, 완전 데이터셋에 대한 추정치는 200배에서 500배의 속도 향상으로 예상된다.
  • 근사 알고리즘과 단순 정확 알고리즘은 정확한 sklearn 기준선과 비교해 군집 품질이 1% 이내로 유사했으며, 정확 알고리즘은 평균적으로 Adjusted Rand Index(Ari)에서 1.8% 높고, NMI에서 0.5% 높았다.
  • 알고리즘의 메모리 사용량은 약 $56m + O(n)$ 바이트이며, 256GB 메모리 시스템에서 수십억 개 정점과 20억~30억 개 간선의 그래프 처리가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.