Skip to main content
QUICK REVIEW

[논문 리뷰] An Efficient Method of Partitioning High Volumes of Multidimensional Data for Parallel Clustering Algorithms

Saraswati Mishra, Avnish Chandra Suman|arXiv (Cornell University)|2016. 09. 20.
Data Management and Algorithms참고 문헌 3인용 수 6
한 줄 요약

이 논문은 스케일러블 K-Means++ 시딩을 사용한 베이저노이 평면의 트리 구조를 활용해 고차원 다차원 데이터를 병렬 클러스터링을 위해 효율적으로 분할하는 새로운 분할 방법을 제안한다. 차원 수가 증가함에 따라 기존의 Kd-트리 및 격자 기반 방법에 비해 확장성과 로드 밸런싱 측면에서 뛰어나며, 특히 수백에서 수천 차원에 이르는 고차원 산업 워크로드에서 유의미한 성능 향상을 보인다.

ABSTRACT

An optimal data partitioning in parallel & distributed implementation of clustering algorithms is a necessary computation as it ensures independent task completion, fair distribution, less number of affected points and better & faster merging. Though partitioning using Kd Tree is being conventionally used in academia, it suffers from performance drenches and bias (non equal distribution) as dimensionality of data increases and hence is not suitable for practical use in industry where dimensionality can be of order of 100s to 1000s. To address these issues we propose two new partitioning techniques using existing mathematical models & study their feasibility, performance (bias and partitioning speed) & possible variants in choosing initial seeds. First method uses an n dimensional hashed grid based approach which is based on mapping the points in space to a set of cubes which hashes the points. Second method uses a tree of voronoi planes where each plane corresponds to a partition. We found that grid based approach was computationally impractical, while using a tree of voronoi planes (using scalable K-Means++ initial seeds) drastically outperformed the Kd-tree tree method as dimensionality increased.

연구 동기 및 목표

  • 고차원 데이터 클러스터링에서 Kd-트리 및 격자 기반 분할의 한계를 해결한다.
  • 대규모 고차원 데이터 세트를 위한 병렬 클러스터링에서 로드 밸런싱을 향상시키고 분할 오버헤드를 줄인다.
  • 수백에서 수천 차원의 산업 응용 분야에 적합한 확장성 있고 편향이 낮은 분할 기법을 개발한다.
  • 분할 품질과 성능을 향상시키기 위해 대안적 초기 시딩 선택 전략을 평가한다.

제안 방법

  • 각 내부 노드가 데이터 공간을 볼록 영역으로 분할하는 베이저노이 평면을 나타내는 트리 기반 구조를 제안한다.
  • 데이터 공간 전역에 잘 분포된 초기 시딩을 확보하기 위해 확장 가능한 K-Means++를 사용하여 초기 시딩을 선택함으로써 분할 편향을 감소시킨다.
  • 각 데이터 포인트는 가장 가까운 베이저노이 평면에 할당되어 데이터 세트의 계층적 분할을 형성한다.
  • 베이저노이 경계를 기반으로 영역을 재귀적으로 분할함으로써 데이터 분포에 동적으로 적응한다.
  • 기하학적 분리 유지와 분할 간의 오버랩 최소화를 위해 공간을 메우는 방식을 채택한다.
  • 분할 속도, 로드 불균형, 확장성 측면에서 Kd-트리 및 해시된 격자 방법과의 성능 비교를 수행한다.

실험 결과

연구 질문

  • RQ1고차원에서 베이저노이 기반 분할 방법이 Kd-트리에 비해 로드 밸런싱과 분할 속도 측면에서 어떻게 성능을 냈는가?
  • RQ2다양한 초기 시딩 선택 전략이 고차원 클러스터링에서 분할 품질과 수렴에 미치는 영향은 무엇인가?
  • RQ3수백에서 수천 차원의 데이터를 가지는 경우, 베이저노이 평면 트리가 성능 저하 없이 효과적으로 처리할 수 있는가?
  • RQ4기존 기법 대비 동적 로드 재균형 과정에서 영향을 받는 포인트 수가 어떻게 감소하는가?
  • RQ5실제로 고차원 데이터 분할에 있어 격자 기반 해싱 접근법은 실현 가능할 수 있는가?

주요 결과

  • 격자 기반 해싱 접근법은 과도한 메모리 및 계산 오버헤드로 인해 고차원 데이터에 대해 계산적으로 비실현 가능하다고 확인되었다.
  • 차원 수가 증가함에 따라 베이저노이 평면 트리 방법이 Kd-트리에 비해 분할 속도와 로드 밸런싱 측면에서 뚜렷한 성능 향상을 보였다.
  • 확장 가능한 K-Means++를 활용한 시딩 선택 전략은 분할 편향을 감소시키고 클러스터 간 데이터 분포를 향상시켰다.
  • 베이저노이 기반 방법은 고차원(1000 이상)에서도 낮은 로드 불균형을 유지했으며, Kd-트리는 성능 저하를 겪었다.
  • 고차원 데이터를 포함한 병렬 클러스터링 워크로드에서 제안된 방법은 뛰어난 확장성과 효율성을 입증했다.
  • 연구 결과, 산업 규모 응용 분야에서 기존 방법에 비해 실현 가능하고 효과적인 대안으로 베이저노이 기반 분할이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.