Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Partial Clustering

Sudipto Guha, Yi Li|arXiv (Cornell University)|2017. 03. 05.
Data Management and Algorithms참고 문헌 17인용 수 13
한 줄 요약

이 논문은 입력 크기의 하위선형 통신을 달성하기 위해 소수의 이상치(t)를 무시할 수 있도록 허용함으로써, 부분 클러스터링—k-center, k-median, k-means—에 대해 통신 효율적인 분산 알고리즘을 제안한다. O(st)에서 O(t)로 통신을 줄이는 데 새로운 기법을 도입하였으며, 부분 k-median 및 k-means에 대해 처음으로 하위평형 알고리즘을 제공하고, 확률 분포를 가진 불확실한 데이터 클러스터링을 위한 첫 번째 분산 알고리즘을 제시한다.

ABSTRACT

Recent years have witnessed an increasing popularity of algorithm design for distributed data, largely due to the fact that massive datasets are often collected and stored in different locations. In the distributed setting communication typically dominates the query processing time. Thus it becomes crucial to design communication efficient algorithms for queries on distributed data. Simultaneously, it has been widely recognized that partial optimizations, where we are allowed to disregard a small part of the data, provide us significantly better solutions. The motivation for disregarded points often arise from noise and other phenomena that are pervasive in large data scenarios. In this paper we focus on partial clustering problems, $k$-center, $k$-median and $k$-means, in the distributed model, and provide algorithms with communication sublinear of the input size. As a consequence we develop the first algorithms for the partial $k$-median and means objectives that run in subquadratic running time. We also initiate the study of distributed algorithms for clustering uncertain data, where each data point can possibly fall into multiple locations under certain probability distribution.

연구 동기 및 목표

  • 작은 수의 점(t)을 무시할 수 있도록 하여 해 품질을 향상시키는 부분 클러스터링 문제에 대해 통신 효율적인 분산 알고리즘을 설계하는 것.
  • 분산 코ordinating 모델에서 부분 k-center, k-median, k-means에 대해 통신 복잡도를 O(st)에서 O(t)로 줄이는 것.
  • 분산 환경에서 부분 k-median 및 k-means에 대해 처음으로 하위평형 시간 알고리즘을 개발하는 것.
  • 각 점이 확률적 위치 분포를 갖는 불확실한 데이터에 대한 분산 클러스터링을 연구하는 것.
  • 통신 효율적인 프레임워크 하나로 부분 클러스터링과 불확실한 데이터 클러스터링을 통합적으로 다루는 것.

제안 방법

  • 통신과 근사 오차를 제한하기 위해 사전 클러스터링과 거리 임계값 설정을 사용하는 2라운드 분산 알고리즘을 제안한다.
  • 점들을 임계값 τ를 기준으로 계층적 클러스터링하여 통신되는 중심점과 이상치의 수를 제한한다.
  • 지역 해를 전역 해로 변환하면서 근사 보장을 유지하기 위해 무작위 반올림 기법을 적용한다.
  • 통신 오버헤드를 최소화하면서 분포 정보를 포괄하는 불확실한 데이터를 위한 새로운 인코딩 체계를 도입한다.
  • 스트리밍 알고리즘의 결과를 활용하여 (k,t)-center에 대해 1라운드 O(1)-근사 알고리즘을 설계하고, 이를 median 및 means로 확장한다.
  • 거리 범위에 대한 이진 탐색을 사용하여 높은 통신 비용 없이 최적의 임계값 τ를 계산한다.

실험 결과

연구 질문

  • RQ1입력 크기의 하위선형 통신과 하위평형 시간으로 작동하는 부분 k-median 및 k-means에 대해 분산 알고리즘을 설계할 수 있는가?
  • RQ2분산 환경에서 부분 클러스터링의 통신 복잡도를 O(st)에서 O(t)로 줄일 수 있는가?
  • RQ3통신을 최소화하면서 근사 품질을 유지하면서 불확실한 데이터를 분산 클러스터링에서 효율적으로 처리할 수 있는가?
  • RQ4일관된 분산 프레임워크 안에서 부분 클러스터링과 불확실한 데이터 클러스터링을 통합적으로 다룰 수 있는가?
  • RQ5두 통신 라운드와 최소한의 로컬 계산만으로 부분 클러스터링에 대해 상수 요율 근사해를 달성할 수 있는가?

주요 결과

  • 논문은 분산 환경에서 부분 k-median 및 k-means에 대해 처음으로 하위평형 시간 알고리즘을 제시하여 이전의 O(n²) 한계를 크게 향상시켰다.
  • 입력 크기의 하위선형 통신을 달성하기 위해 부분 k-center, k-median, k-means에 대해 통신 복잡도를 O(st)에서 O(t)로 줄였다.
  • 불확실한 데이터의 경우, 2라운드로 O(1+1/ε)-근사해를 달성하며 통신 비용은 O(s(kB + tI)logΔ + s/δ + skB)이다. 여기서 I는 노드의 인코딩 크기이다.
  • (k,t)-center-g에 대한 알고리즘은 2라운드로 O(1+1/ε)-근사해를 달성하며 통신 비용은 O(s(kB + tI)logΔ)이다. 이는 이전 작업보다 향상된 성능이다.
  • 각 사이트에서의 런타임은 O((k+t)ni logΔ)이며, 코ordinating 서버의 런타임은 O((sk+t)²)이다. 일반적인 매개변수 설정 하에서는 입력 크기의 하위평형이다.
  • 이 프레임워크는 이상치 내성과 불확실한 데이터 모델링을 모두 지원하여, 분산 시스템에서의 실제 노이즈가 많은 데이터와 확률적 데이터에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.