Skip to main content
QUICK REVIEW

[논문 리뷰] Online Hierarchical Clustering Approximations

Aditya Krishna Menon, Anand Rajagopalan|arXiv (Cornell University)|2019. 09. 20.
Advanced Clustering Algorithms Research참고 문헌 18인용 수 4
한 줄 요약

이 논문은 최적의 계층적 군집화를 위한 Moseley-Wang (MW) 수익 함수를 근사하는 두 가지 온라인 계층적 군집화 알고리즘, OTD와 OHAC를 제안한다. OTD는 데이터 분리 조건 하에서 $\frac{\beta}{3}$-근사 보장을 갖는 상향식 접근 방식을 사용하며, OHAC는 새로운 분할-병합 절차를 통해 오프라인 HAC를 모방하여 근사적으로 최적의 MW 수익을 달성하고, $O(n)$ 라운드당 복잡도를 갖는 뛰어난 군집 품질을 제공한다.

ABSTRACT

Hierarchical clustering is a widely used approach for clustering datasets at multiple levels of granularity. Despite its popularity, existing algorithms such as hierarchical agglomerative clustering (HAC) are limited to the offline setting, and thus require the entire dataset to be available. This prohibits their use on large datasets commonly encountered in modern learning applications. In this paper, we consider hierarchical clustering in the online setting, where points arrive one at a time. We propose two algorithms that seek to optimize the Moseley and Wang (MW) revenue function, a variant of the Dasgupta cost. These algorithms offer different tradeoffs between efficiency and MW revenue performance. The first algorithm, OTD, is a highly efficient Online Top Down algorithm which provably achieves a 1/3-approximation to the MW revenue under a data separation assumption. The second algorithm, OHAC, is an online counterpart to offline HAC, which is known to yield a 1/3-approximation to the MW revenue, and produce good quality clusters in practice. We show that OHAC approximates offline HAC by leveraging a novel split-merge procedure. We empirically show that OTD and OHAC offer significant efficiency and cluster quality gains respectively over baselines.

연구 동기 및 목표

  • 대규모 스트리밍 데이터를 위한 효율적이고 이론적으로 탄탄한 온라인 계층적 군집화 알고리즘이 부족한 문제를 해결하기 위해.
  • Moseley와 Wang(2017)의 수익 함수를 최적화하는 온라인 알고리즘을 설계하기 위해. 이는 계층적 군집화 품질에 대한 원칙적인 목표이다.
  • 온라인 환경에서 계산 효율성과 군집 품질 사이의 균형을 이루기 위해.
  • 이론적 근사 보장과 오프라인 기준 및 기존 온라인 방법과의 실증적 검증을 제공하기 위해.

제안 방법

  • OTD는 각 도착 포인트당 한 번의 루트에서 리프로 향하는 트리 탐색을 수행하는 온라인 상향식 계층적 군집화 알고리즘으로, $d$가 계층의 깊이일 때 $O(d)$ 라운드당 시간 복잡도를 보장한다.
  • OTD는 데이터 포인트 간 분리도를 측정하는 $\beta$를 기반으로 $\frac{\beta}{3}$-근사 보장을 확보하며, 잘 분리된 조건에서는 $\frac{1}{3}$-근사 보장을 달성한다.
  • OHAC는 오프라인 HAC의 온라인 대응체로, 새로운 분할-병합 절차를 사용하여 동적으로 군집 구조를 유지하고 오프라인 HAC의 계층을 근사한다.
  • OHAC는 특정 연결 방식에 대해 $O(n)$ 라운드당 시간 복잡도를 가지며, 오프라인 HAC와 거의 동일한 MW 수익 성능을 달성한다.
  • 알고리즘 평가에는 오프라인 HAC와의 근사 품질을 측정하기 위해 MW 수익과 트리플릿 거리가 사용된다.
  • 이론적 분석은 데이터 분리 가정 하에서 근사 경계를 증명하는 데 사용되며, 실증 평가는 MNIST와 ImageNet을 포함한 합성 및 실세계 데이터셋을 활용한다.

실험 결과

연구 질문

  • RQ1온라인 계층적 군집화 알고리즘이 Moseley-Wang 수익 함수에 대해 이론적 근사 보장을 달성할 수 있는가?
  • RQ2군집 품질과 런타임 측면에서 온라인 알고리즘의 성능은 오프라인 HAC와 어떻게 비교되는가?
  • RQ3간단하고 효율적인 상향식 온라인 알고리즘인 OTD가 단순성과 효율성에도 불구하고 강력한 근사 요인을 달성할 수 있는가?
  • RQ4분할-병합 메커니즘을 통해 오프라인 HAC를 모방하는 온라인 알고리즘이 계층적 구조를 유지하고 MW 수익을 향상시킬 수 있는가?
  • RQ5온라인 계층적 군집화에서 계산 효율성과 군집 품질 사이의 트레이드오프는 무엇인가?

주요 결과

  • OTD는 엄격한 데이터 분리 조건 없이도 실세계 및 합성 데이터셋에서 이론적 $\frac{1}{3}$-근사 요인을 일관되게 달성하거나 초월한다.
  • OHAC는 오프라인 HAC와 거의 동일한 MW 수익 성능을 달성하여 최적의 계층을 근사하는 능력을 검증한다.
  • 오프라인 HAC는 가장 높은 군집 품질을 제공하지만, ImageNet과 같은 대규모 데이터셋에서는 실행이 불가능하며, 7만 개 포인트에서 메모리가 부족해져 중단된다.
  • OTD는 OHAC와 오프라인 HAC보다 훨씬 빠르며, 런타임이 비선형적으로 증가하여 고처리량 스트리밍 응용에 적합하다.
  • OHAC는 트리플릿 거리 측정에서 PERCH 및 기타 기준보다 뛰어나, 기존 온라인 방법보다 계층적 구조를 더 잘 유지한다.
  • 100만 개 이상의 포인트를 포함하는 ImageNet 데이터셋에서 OTD와 OHAC는 합리적인 시간 내에 완료되지만, 오프라인 HAC는 8시간 이내에 완료되지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.