Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Clustering via Sketches and Hierarchical Correlation Clustering

Danny Vainstein, Vaggos Chatziafratis|arXiv (Cornell University)|2021. 01. 26.
Advanced Clustering Algorithms Research인용 수 5
한 줄 요약

이 논문은 일정 크기의 스케치를 갖는 계층적 클러스터링 트리가, 모든 가중치가 작지 않은 한 Revenue 및 Dissimilarity 목표 함수에 대해 최적 해를 임의로 가까이 근사할 수 있음을 보여주는 구조적 보조정리를 제안한다. 이는 이러한 목표 함수에 대해 효율적인 다항 시간 랜덤화 근사 계획법(Efficient-PRAS)을 달성하며, 유사도 및 이질성 정보를 통합하는 계층적 상관관계 클러스터링(HCC)을 제안하여 0.4767의 근사 비율과 보완적인 유사도/이질성 인스턴스에 대해 Efficient-PRAS를 제공한다.

ABSTRACT

Recently, Hierarchical Clustering (HC) has been considered through the lens of optimization. In particular, two maximization objectives have been defined. Moseley and Wang defined the \\emph{Revenue} objective to handle similarity information given by a weighted graph on the data points (w.l.o.g., $[0,1]$ weights), while Cohen-Addad et al. defined the \\emph{Dissimilarity} objective to handle dissimilarity information. In this paper, we prove structural lemmas for both objectives allowing us to convert any HC tree to a tree with constant number of internal nodes while incurring an arbitrarily small loss in each objective. Although the best-known approximations are 0.585 and 0.667 respectively, using our lemmas we obtain approximations arbitrarily close to 1, if not all weights are small (i.e., there exist constants $\\epsilon, \\delta$ such that the fraction of weights smaller than $\\delta$, is at most $1 - \\epsilon$); such instances encompass many metric-based similarity instances, thereby improving upon prior work. Finally, we introduce Hierarchical Correlation Clustering (HCC) to handle instances that contain similarity and dissimilarity information simultaneously. For HCC, we provide an approximation of 0.4767 and for complementary similarity/dissimilarity weights (analogous to $+/-$ correlation clustering), we again present nearly-optimal approximations.

연구 동기 및 목표

  • 기존 계층적 클러스터링(HC) 근사 알고리즘의 한계를 해결하기 위해, 최적 해에서 벗어나지 않는 근사 비율(예: 0.585 및 0.667)을 초월하는 것.
  • 근본적인 APX-난이도를 고려할지라도 근사 비율을 1에 임의로 가까이 만들 수 있는 광범위한 HC 인스턴스의 클래스를 규명하는 것.
  • 계층적 클러스터링에서 유사도 및 이질성 정보를 통합하기 위해 새로운 목표 함수인 계층적 상관관계 클러스터링(HCC)을 도입하는 것.
  • 특히 보완적인 유사도/이질성(±) 가중치를 갖는 경우, HCC에 대해 효율적인 근사 계획법을 제공하는 것.
  • 거리 기반 유사도 인스턴스와 최소 유사도가 유계인 가우시안 커널 기반 인스턴스가 거의 최적의 근사가 가능한 인스턴스의 클래스에 포함됨을 보여주는 것.

제안 방법

  • 트리의 스케치(모든 잎을 제거한 후의 트리) 개념을 도입하고, Revenue 및 Dissimilarity 목표 함수에 대해 최적의 HC 트리를 근사하기 위해 일정 크기의 스케치로도 충분함을 증명한다.
  • 모든 가중치가 작지 않은 경우에 대해 Goldreich 등(1998)의 Max-Uncut Bisection에 대한 기초 연구를 활용하여 근사 알고리즘을 설계한다.
  • Max-Uncut Bisection과 근사적 분할을 조합한 하이브리드 알고리즘을 제안하여 HCC에 대해 0.4767의 근사 비율을 달성한다.
  • 두 하위 알고리즘을 동시에 실행하고 결과 중 더 나은 HCC 트리를 반환하는 동시 알고리즘(ALG±)을 설계하여 HCC± 목표 함수에 대해 Efficient-PRAS를 달성한다.
  • 구조적 보조정리를 활용하여, 어떤 HC 트리라도 스케치의 크기가 일정한 트리로 대체할 경우 발생하는 손실를 제한함으로써, 유한한 후보 트리 집합 내에서 효율적인 탐색이 가능하게 한다.
  • 근사 프레임워크의 핵심 구성 요소로 Alon 등(2020)의 Max-Uncut Bisection에 대한 0.8776-근사 비율을 적용한다.

실험 결과

연구 질문

  • RQ1Revenue 및 Dissimilarity 목표 함수 하에서, 기존의 알려진 0.585 및 0.667 이론적 한계를 초월하여 근사 비율을 1에 임의로 가까이 만들 수 있는가?
  • RQ2계층적 클러스터링 문제의 본질적 APX-난이도가 존재하더라도, 근본적으로 거의 최적의 근사가 가능한 자연스러운 HC 인스턴스의 클래스가 존재하는가?
  • RQ3유사도 및 이질성 정보를 새로운 목표 함수를 통해 계층적 클러스터링에 통합할 수 있으며, 만약 가능하다면 어떤 근사 보장을 달성할 수 있는가?
  • RQ4HCC 목표 함수는 보완적인 유사도/이질성 가중치를 갖는 인스턴스에서 효율적인 다항 시간 근사 계획법(Efficient-PRAS)을 제공하는가?
  • RQ5거리 기반 유사도 인스턴스와 최소 유사도가 유계인 가우시안 커널 기반 인스턴스는 거의 최적의 근사가 가능한 인스턴스의 클래스에 포함되는가?

주요 결과

  • Revenue 및 Dissimilarity 목표 함수 모두에서, 어떤 HC 트리라도 일정 크기의 스케치를 갖는 트리로 대체해도 목표 함수 값의 손실가 임의로 작게 유지됨을 증명한다.
  • 모든 가중치가 작지 않은 경우(즉, 일정 비율의 가중치가 δ > 0 이상임)에, Revenue 및 Dissimilarity 목표 함수에 대해 Efficient-PRAS를 달성한다.
  • 기존 근사치보다 향상된 결과를 도출한다: δ = Ω(1)인 가우시안 커널 인스턴스의 경우, 근사 비율이 (1+δ)/3에서 거의 최적에 가까운 수준으로 향상된다.
  • 유사도 및 이질성 정보를 동시에 처리할 수 있는 계층적 상관관계 클러스터링(HCC)을 도입하였으며, worst-case 근사 비율이 0.4767임을 보여준다.
  • HCC± 목표 함수에 대해 Efficient-PRAS를 달성하여, 문제의 NP-완전성에도 불구하고 임의의 정밀도로 효율적으로 근사 가능함을 보여준다.
  • 이 프레임워크는 거리 기반 유사도 인스턴스에 적용 가능하며, 저차원 환경에서 좋은 근사가 가능한지에 대한 열린 질문을 해결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.