Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering with Obstacles in Spatial Databases

Mohamed A. El-Zawawy, Mohamed E. El-Sharkawi|ArXiv.org|2009. 09. 24.
Data Management and Algorithms참고 문헌 14인용 수 4
한 줄 요약

이 논문은 강과 고속도로와 같은 물리적 장애물을 고려한 공간 데이터베이스를 위한 클러스터링 알고리즘인 CPO를 제안한다. 공간을 세포로 나누고, 장애물이 있는지 여부를 표시한 후 비장애물 영역에서 너비 우선 탐색을 사용하여 밀도가 높은 클러스터의 중심을 식별함으로써, 전통적인 클러스터링 결과에 영향을 미치는 장애물로 인해 왜곡되는 실제 공간 데이터 마이닝에서 정확도를 향상시킨다.

ABSTRACT

Clustering large spatial databases is an important problem, which tries to find the densely populated regions in a spatial area to be used in data mining, knowledge discovery, or efficient information retrieval. However most algorithms have ignored the fact that physical obstacles such as rivers, lakes, and highways exist in the real world and could thus affect the result of the clustering. In this paper, we propose CPO, an efficient clustering technique to solve the problem of clustering in the presence of obstacles. The proposed algorithm divides the spatial area into rectangular cells. Each cell is associated with statistical information used to label the cell as dense or non-dense. It also labels each cell as obstructed (i.e. intersects any obstacle) or nonobstructed. For each obstructed cell, the algorithm finds a number of non-obstructed sub-cells. Then it finds the dense regions of non-obstructed cells or sub-cells by a breadthfirst search as the required clusters with a center to each region.

연구 동기 및 목표

  • 공간 데이터베이스에서 물리적 장애물을 忽시하는 전통적 클러스터링 알고리즘의 한계를 해결하기 위해.
  • 강, 호수, 고속도로와 같은 장애물을 포함시켜 실제 공간 데이터 마이닝에서 클러스터링 정확도를 향상시키기 위해.
  • 장애물에 의해 차단되지 않은 밀도가 높은 영역을 효율적으로 탐지하여 현실적인 클러스터 형성 보장하기 위해.
  • 공간 제약이 데이터 분포에 영향을 미치는 공간 데이터베이스에서 효과적인 데이터 마이닝 및 지식 발견을 가능하게 하기 위해.

제안 방법

  • 공간 데이터베이스 영역을 직사각형 세포로 나누어 공간 분할을 수행한다.
  • 통계 정보를 기반으로 각 세포를 밀도가 높은지 또는 낮은지로 레이블링하고, 물리적 장애물과 겹치면 장애물 있음 또는 없음으로 표시한다.
  • 장애물이 있는 세포의 경우, 잠재적 클러스터 영역을 유지하기 위해 비장애물 세포로 하위 세포를 식별한다.
  • 비장애물 세포 또는 하위 세포를 탐색하고 연결된 밀도가 높은 영역으로 그룹화하기 위해 너비 우선 탐색(BFS)을 적용한다.
  • 식별된 밀도가 높은 영역 각각에 중심을 할당하여 클러스터를 대표한다.
  • 세포당 통계 데이터를 사용하여 밀도 결정을 유도하고 불필요한 계산을 방지한다.

실험 결과

연구 질문

  • RQ1강과 고속도로와 같은 물리적 장애물이 존재할 경우 공간 데이터베이스에서 클러스터링을 어떻게 향상시킬 수 있는가?
  • RQ2장애물에 의해 차단되지 않은 밀도가 높은 공간 영역을 효율적으로 탐지하는 방법은 무엇인가?
  • RQ3장애물의 공간적 구조를 클러스터링 과정에 통합하면서 계산 오버헤드를 증가시키지 않고 어떻게 할 수 있는가?
  • RQ4세포 기반 접근법과 BFS를 사용하여 장애물 영향을 받는 공간 데이터에서 의미 있는 클러스터를 효과적으로 식별할 수 있는가?

주요 결과

  • CPO 알고리즘은 물리적 장애물을 고려하여 공간 데이터베이스에서 밀도가 높은 클러스터를 성공적으로 식별함으로써 더 현실적인 클러스터 형성 결과를 도출한다.
  • 세포를 장애물 있음 또는 없음으로 레이블링하고 장애물 영역 내 하위 세포를 분석함으로써 CPO는 클러스터 탐지에서 공간의 무결성을 유지한다.
  • 너비 우선 탐색의 사용은 비장애물 영역의 효율적 탐색을 가능하게 하여 대규모 공간 데이터셋에 대한 확장성 확보한다.
  • 세포를 밀도가 높음 또는 낮음으로 통계 기반으로 레이블링함으로써 불필요한 처리를 줄이고 클러스터링 성능 향상된다.
  • 장애물이 공간 데이터 분포에 상당한 영향을 미치는 실제 시나리오에서도 알고리즘이 정확한 클러스터링 결과를 도출한다.
  • 이 방법은 IEEE ISSPIT 2001 회의에서 사례 연구를 통해 검증되었으며, 공간 데이터 마이닝에서의 실용적 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.