Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering High Dimensional Dynamic Data Streams

Vladimir Braverman, Gereon Frahling|arXiv (Cornell University)|2017. 06. 13.
Data Stream Mining Techniques참고 문헌 21인용 수 17
한 줄 요약

이 논문은 차원 d에 대해 다항식이고 도메인 크기 ∆에 대해 로그항인 공간을 사용하면서 삽입 및 삭제가 가능한 고차원 동적 데이터 스트림에서 k-median 문제에 대해 처음으로 (1+ϵ)-근사 알고리즘을 제시한다. 계층적 클러스터링과 헤비히터 추적을 통한 코어셋 구축 방식을 도입하여, O(kd⁴L⁴/ϵ²)의 코어셋 크기와 ˜O(kd⁷L⁷/ϵ²)의 공간 복잡도를 달성하며, 높은 확률 하에서 (1+ϵ)-근사 보장을 보장한다. 여기서 L = log ∆이다.

ABSTRACT

We present data streaming algorithms for the $k$-median problem in high-dimensional dynamic geometric data streams, i.e. streams allowing both insertions and deletions of points from a discrete Euclidean space $\{1, 2, \ldots Δ\}^d$. Our algorithms use $k ε^{-2} poly(d \log Δ)$ space/time and maintain with high probability a small weighted set of points (a coreset) such that for every set of $k$ centers the cost of the coreset $(1+ε)$-approximates the cost of the streamed point set. We also provide algorithms that guarantee only positive weights in the coreset with additional logarithmic factors in the space and time complexities. We can use this positively-weighted coreset to compute a $(1+ε)$-approximation for the $k$-median problem by any efficient offline $k$-median algorithm. All previous algorithms for computing a $(1+ε)$-approximation for the $k$-median problem over dynamic data streams required space and time exponential in $d$. Our algorithms can be generalized to metric spaces of bounded doubling dimension.

연구 동기 및 목표

  • 이전 방법이 차원 d에 대해 지수적 공간을 요구함에 비해, 삽입 및 삭제가 가능한 고차원 데이터 스트림의 클러스터링 문제에 도전한다.
  • 삽입 및 삭제를 지원하면서 (1+ϵ) 요소 이내의 근사 비용을 유지하는 작은 가중치 코어셋을 유지하는 스트리밍 알고리즘을 개발한다.
  • 단일 패assing 모델에서 부분선형 공간과 다항시간 업데이트/질의 연산을 보장하면서 코어셋 구축을 보장한다.
  • 기존 오프라인 k-median 솔버와의 호환성을 보장하기 위해 음수 가중치와 비음수 가중치 코어셋 버전을 모두 제공한다.
  • 유계 이중 차원을 가진 메트릭 공간으로 이 접근법을 일반화한다.

제안 방법

  • 점의 도메인 [∆]^d에 대해 계층적 격자 구조를 사용하여 다수의 수준에서 셀으로 점을 분할함으로써 국소적 비용 추정을 가능하게 한다.
  • 각 셀에서 점을 샘플링하기 위해 무작위 해싱 기법을 적용하여 높은 밀도 영역을 잘 반영하도록 보장한다.
  • HEAVY-HITTER 데이터 구조를 활용하여 전체 비용에 기여하는 가장 중요한 셀(헤비 셀)을 식별하고 추적한다.
  • 헤비 셀과 희소 셀의 샘플을 조합하여 코어셋을 구성하며, 추정된 빈도와 확률적 한계에 기반한 가중 기여도를 사용한다.
  • 각 클러스터 영역의 추가 오차를 제어함으로써 (1+ϵ)-근사 보장을 유지하는 재귀적 코어셋 정밀화 과정을 적용한다.
  • 최종 코어셋의 가중치를 조정하여 비음수성을 보장하고 근사의 정확성을 확보하는 정규화 단계를 수행한다.

실험 결과

연구 질문

  • RQ1차원 d와 ∆의 로그에 대해 다항식 공간을 사용하면서 고차원 동적 데이터 스트림에서 k-median 문제에 대해 (1+ϵ)-근사가 가능할 수 있는가?
  • RQ2삽입 및 삭제를 모두 지원하면서 (1+ϵ)-근사 보장을 유지하는 단일 패assing 코어셋은 어떻게 구축할 수 있는가?
  • RQ3고확률 하에서 이러한 코어셋을 유지하기 위해 필요한 최소 공간 및 시간 복잡도는 무엇인가?
  • RQ4표준 오프라인 k-median 알고리즘과의 호환성을 확보하기 위해 코어셋을 오직 비음수 가중치로 구성할 수 있는가?
  • RQ5이 접근법은 유계 이중 차원을 가진 일반 메트릭 공간으로 일반화될 수 있는가?

주요 결과

  • 알고리즘은 ˜O(kd⁷L⁷/ϵ²)의 공간 복잡도로 동적 고차원 스트림에서 k-median 문제에 대해 (1+ϵ)-근사 보장을 달성한다. 여기서 L = log ∆이다.
  • 코어셋 크기는 O(kd⁴L⁴/ϵ²)이며, 업데이트당 다항식 시간 복잡도(다항식(d, k, L, 1/ϵ))로 계산할 수 있다.
  • 계층적 샘플링과 헤비히터 추적의 조합을 통해 고확률(≥0.99)로 코어셋을 유지한다.
  • 비음수 가중치만을 사용하는 변형 버전을 제공하나, 이는 약간 증가된 공간 및 시간 복잡도를 수반하며, 이제 ˜O(kd⁸L⁸/ϵ²)가 된다.
  • 이 접근법은 이중 차원이 유계된 메트릭 공간으로 일반화되며, (1+ϵ)-근사 보장이 유지된다.
  • 코어셋 구축 과정은 임의의 k개의 중심에 대해 코어셋 비용이 전체 점 집합의 진짜 비용을 (1+ϵ)-근사로 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.