Skip to main content
QUICK REVIEW

[논문 리뷰] Modern hierarchical, agglomerative clustering algorithms

Daniel Müllner|arXiv (Cornell University)|2011. 09. 12.
Advanced Clustering Algorithms Research인용 수 369
한 줄 요약

이 논문은 중심점 및 중앙값 연결법에 대해 효과적으로 작동하는 새로운 일반적인 적층 클러스터링 알고리즘을 소개한다. 이 알고리즘은 기존 방법보다 크게 뛰어난 성능을 보이며, Rohlf와 Murtagh의 알고리즘의 정확성을 증명하고 각 연결법에 최적의 알고리즘 추천을 제시하며, R과 파이썬용 구현을 제공함으로써 이론과 실무를 연결한다.

ABSTRACT

This paper presents algorithms for hierarchical, agglomerative clustering which perform most efficiently in the general-purpose setup that is given in modern standard software. Requirements are: (1) the input data is given by pairwise dissimilarities between data points, but extensions to vector data are also discussed (2) the output is a "stepwise dendrogram", a data structure which is shared by all implementations in current standard software. We present algorithms (old and new) which perform clustering in this setting efficiently, both in an asymptotic worst-case analysis and from a practical point of view. The main contributions of this paper are: (1) We present a new algorithm which is suitable for any distance update scheme and performs significantly better than the existing algorithms. (2) We prove the correctness of two algorithms by Rohlf and Murtagh, which is necessary in each case for different reasons. (3) We give well-founded recommendations for the best current algorithms for the various agglomerative clustering schemes.

연구 동기 및 목표

  • 계층 클러스터링 분야의 이론적 진전과 표준 소프트웨어에서의 열악한 구현 간 격차를 해소한다.
  • 현대 통계 소프트웨어에서 널리 사용되는 일반적인 입력/출력 형식을 기반으로, 효율적이고 정확하며 실용적인 적층 클러스터링 알고리즘을 개발한다.
  • 이전에 증명되지 않은 알고리즘, 특히 Rohlf의 MST 기반 단일 연결법과 Murtagh의 근접 이웃 체인 알고리즘에 대한 형식적 정확성 증명을 제공한다.
  • 이론적 및 실험적 분석을 바탕으로 7개 주요 적층 클러스터링 방식 각각에 대해 최고 성능을 보이는 알고리즘을 추천한다.
  • 유클리드 거리 기반 방식인 Ward, 중심점, 중앙값 연결법과 같은 효율적 변형을 제안함으로써 벡터 데이터로의 범위 확장을 도모한다.

제안 방법

  • 우선순위 큐와 인-place 배열 업데이트를 사용하여 이질성 거리 갱신을 동적으로 유지하는 새로운 일반 클러스터링 알고리즘(Generic_linkage 및 그 변형)을 제안한다.
  • 단일 연결 클러스터링을 위해 최소 스패닝 트리(MST) 알고리즘을 변형하여 실시간 거리 계산을 가능하게 하고 메모리 오버헤드를 줄인다.
  • Murtagh의 근접 이웃 체인 알고리즘을 완전, 평균, 가중, Ward 연결법에 적용하며 중심점 기반 거리 갱신을 사용한다.
  • 스텝별 디그램을 출력 데이터 구조로 사용하여 R 및 SciPy와 같은 표준 소프트웨어와의 호환성을 확보한다.
  • C++로 알고리즘을 구현하고 R 및 파이썬 인터페이스를 제공하여 실무 적용을 가능하게 한다.
  • 각 클러스터를 레이블로 표현하고, 중복된 거리 계산을 방지하기 위해 우선순위 큐(mindist)를 통해 근접 이웃을 추적하는 동적 데이터 구조를 사용한다.

실험 결과

연구 질문

  • RQ1일반 목적의 입력/출력 형식 하에서 모든 표준 연결법에 대해 최적의 성능을 보이는 적층 클러스터링 알고리즘은 무엇인가?
  • RQ2기존 소프트웨어 구현이 왜 열악한가? 이론적 개선 사항을 실무에 효과적으로 연결할 수 있는 방법은 무엇인가?
  • RQ3Rohlf의 MST 기반 알고리즘과 Murtagh의 근접 이웃 체인 알고리즘의 정확성 조건은 무엇이며, 왜 이전에 증명이 누락되었는가?
  • RQ4출력 데이터 구조의 선택(예: 스텝별 디그램)이 알고리즘의 타당성과 효율성에 어떤 영향을 미치는가?
  • RQ5임의의 거리 갱신 공식을 지원하면서도 높은 성능을 유지할 수 있는 단일 일반 알고리즘을 설계할 수 있는가?

주요 결과

  • 제안된 Generic_linkage 알고리즘은 중심점 및 중앙값 연결법에 대해 기존 방법보다 뛰어난 성능을 보이며, 실무에서 더 적은 재계산을 보이는 단순화된 변형(Generic_linkage_variant)도 존재한다.
  • Rohlf의 MST 기반 알고리즘의 단일 연결법 및 Murtagh의 근접 이웃 체인 알고리즘의 완전/평균/가중/Ward 연결법에 대한 정확성은 이 논문에서 최초로 형식적으로 증명되었다.
  • MST 알고리즘을 통해 실시간 거리 계산이 가능해져 전체 이질성 행렬을 사전에 계산할 필요 없이 메모리 사용량을 줄일 수 있다.
  • 유클리드 벡터 데이터에 대해서는 Generic_linkage 알고리즘과 그 변형이 Ward, 중심점, 중앙값 연결법에 대해 최적의 성능을 보이며, 효율적인 근접 이웃 추적 덕분에 성능 향상이 이루어진다.
  • 스텝별 디그램은 알고리즘의 정확성과 표준 소프트웨어와의 호환성을 확보하기 위해 필수적이고 충분한 출력 구조임을 입증하였다.
  • 일반적인 이질성 입력 설정 하에서 어떤 알고리즘도 Ω(N²) 시간 복잡도 이하로는 성능을 향상시킬 수 없으며, 이는 이론적 하한선을 확인함으로써 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.