Skip to main content
QUICK REVIEW

[논문 리뷰] PS-DBSCAN: An Efficient Parallel DBSCAN Algorithm Based on Platform Of AI (PAI)

Hu Xu, Jun Huang|arXiv (Cornell University)|2017. 11. 03.
Graph Theory and Algorithms인용 수 5
한 줄 요약

PS-DBSCAN은 파라미터 서버 프레임워크와 빠른 글로벌 유니온 기법을 활용하여 분산 클러스터링에서 통신 오버헤드를 줄이는 통신 효율적인 병렬 DBSCAN 알고리즘입니다. 서로소 집합을 사용하고 워커 간 조율를 최소화함으로써 다양한 데이터셋 규모에서 MPI 기반의 PDSDBSCAN-D 대비 통신 효율성에서 2–10배의 성능 향상을 달성합니다.

ABSTRACT

We present PS-DBSCAN, a communication efficient parallel DBSCAN algorithm that combines the disjoint-set data structure and Parameter Server framework in Platform of AI (PAI). Since data points within the same cluster may be distributed over different workers which result in several disjoint-sets, merging them incurs large communication costs. In our algorithm, we employ a fast global union approach to union the disjoint-sets to alleviate the communication burden. Experiments over the datasets of different scales demonstrate that PS-DBSCAN outperforms the PDSDBSCAN with 2-10 times speedup on communication efficiency. We have released our PS-DBSCAN in an algorithm platform called Platform of AI (PAI - https://pai.base.shuju.aliyun.com/) in Alibaba Cloud. We have also demonstrated how to use the method in PAI.

연구 동기 및 목표

  • 핵심 포인트가 여러 워커에 분산되어 있을 경우 병렬 DBSCAN에서 발생하는 높은 통신 비용을 해결하기 위해.
  • 클러스터 병합 과정에서 워커 간 조율를 최소화하여 분산 DBSCAN의 통신 오버헤드를 줄이기 위해.
  • 파라미터 서버 아키텍처를 활용하여 밀도 기반 클러스터링의 확장성과 성능을 향상시키기 위해.
  • 알리바바의 AI 플랫폼(PAI)에서 사용 가능한 프로덕션 수준의 확장 가능한 DBSCAN 구현을 제공하기 위해.

제안 방법

  • 알고리즘은 데이터 포인트를 여러 워커에 나누어 배분하고, 로컬 클러스터 멤버십을 관리하기 위해 서로소 집합 데이터 구조를 사용합니다.
  • 각 워커는 에프클로즈 네ighborhood 및 minPoints 기준을 사용하여 로컬 클러스터링을 수행하여 핵심 포인트를 식별하고 로컬 클러스터를 형성합니다.
  • 파라미터 서버 프레임워크를 통해 로컬 레이블 업데이트를 중앙 서버로 전송함으로써 워커 간 서로소 집합을 빠르게 통합하는 글로벌 유니온 메커니즘이 적용됩니다.
  • 라벨 충돌을 해결하고 일관된 클러스터 레이블을 전파하기 위해 반복 단계인 PropagateMaxLabel, MaxReduceToServer, PullFromServer, GlobalUnion, GetMaxLabel가 사용됩니다.
  • 글로벌 레이블 벡터는 서버에 유지되며, 워커들은 로컬 레이블을 동기화하여 시스템 전반의 일관성을 확보합니다.
  • 메시지 수와 빈도를 줄이기 위해 피어 투 피어 통신을 피하고 중심화된 조율 모델을 사용함으로써 비용이 많이 드는 통신을 방지합니다.

실험 결과

연구 질문

  • RQ1클러스터가 여러 워커에 걸쳐 있을 경우 병렬 DBSCAN에서 통신 오버헤드를 어떻게 최소화할 수 있는가?
  • RQ2파라미터 서버 기반 프레임워크가 기존의 MPI 기반 구현 대비 DBSCAN의 통신 효율성에서 뛰어나게 작용할 수 있는가?
  • RQ3PS-DBSCAN의 성능은 데이터셋 크기와 처리 코어 수가 증가함에 따라 어떻게 확장되는가?
  • RQ4빠른 글로벌 유니온 기법을 사용할 경우 분산 DBSCAN에서 클러스터 병합 효율성에 어떤 영향을 미치는가?

주요 결과

  • PS-DBSCAN은 실제 및 합성 데이터셋 모두에서 MPI 기반의 PDSDBSCAN-D 대비 통신 효율성에서 2–10배의 성능 향상을 달성합니다.
  • 성능 향상은 프로세서 코어 수와 데이터셋 크기가 증가함에 따라 커지며, 강력한 확장성을 보여줍니다.
  • 워커 간 피어 투 피어 병합을 파라미터 서버를 통한 중심화된 레이블 동기화로 대체함으로써 통신 비용을 줄입니다.
  • 빠른 글로벌 유니온 기법을 사용함으로써 워커 간 서로소 집합을 병합하기 위해 필요한 통신 라운드 수를 크게 감소시킵니다.
  • PS-DBSCAN은 알리바바의 플랫폼 오브 AI(PAI)에 배포되어 실제 운영 환경에서 기동되었으며, MaxCompute에서 벡터 및 링크 기반 입력 형식을 지원합니다.
  • 멀티스레딩과 분산 메모리 시스템을 조합하면 성능 향상이 가능함을 보여주며, 향후 최적화를 위한 방향성을 제시합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.