Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale Geospatial Processing on Multi-Core and Many-Core Processors: Evaluations on CPUs, GPUs and MICs.

Jianting Zhang, Simin You|arXiv (Cornell University)|2014. 03. 04.
Data Management and Algorithms참고 문헌 13인용 수 5
한 줄 요약

이 논문은 실세계 데이터를 사용하여 다중 코어 CPU, GPU, Intel MIC 가속기에서 대규모 지리공간 처리—특히 점에서 다각형선까지의 최단 거리(P2P) 및 점이 다각형 내부에 있는지 여부(PIP) 테스트—를 평가한다. 이는 CPU 및 MIC에서 벡터 처리 유닛(VPU)을 활용할 경우 GPU보다 수 배 빠른 성능을 낼 수 있음을 보여주며, 저수준 인트린식 프로그래밍 없이 SIMD 기능을 효율적으로 활용할 수 있는 도메인 특화 언어(DSL) 접근법을 제안한다. 이는 이식성과 확장성을 향상시킨다.

ABSTRACT

Geospatial Processing, such as queries based on point-to-polyline shortest distance and point-in-polygon test, are fundamental to many scientific and engineering applications, including post-processing large-scale environmental and climate model outputs and analyzing traffic and travel patterns from massive GPS collections in transportation engineering and urban studies. Commodity parallel hardware, such as multi-core CPUs, many-core GPUs and Intel MIC accelerators, provide enormous computing power which can potentially achieve significant speedups on existing geospatial processing and open the opportunities for new applications. However, the realizable potential for geospatial processing on these new hardware devices is largely unknown due to the complexity in porting serial algorithms to diverse parallel hardware platforms. In this study, we aim at experimenting our data-parallel designs and implementations of point-to-polyline shortest distance computation (P2P) and point-in-polygon topological test (PIP) on different commodity hardware using real large-scale geospatial data, comparing their performance and discussing important factors that may significantly affect the performance. Our experiments have shown that, while GPUs can be several times faster than multi-core CPUs without utilizing the increasingly available SIMD computing power on Vector Processing Units (VPUs) that come with multi-core CPUs and MICs, multi-core CPUs and MICs can be several times faster than GPUs when VPUs are utilized. By adopting a Domain Specific Language (DSL) approach to exploiting the VPU computing power in geospatial processing, we are free from programming SIMD intrinsic functions directly which makes the new approach more effective, portable and scalable. Our designs, implementations and experiments can serve as case studies for parallel geospatial computing on modern commodity parallel hardware.

연구 동기 및 목표

  • 일반적인 병렬 하드웨어 플랫폼에서 대규모 지리공간 처리 워크로드—P2P 및 PIP—의 성능을 평가하기 위해.
  • 일반적인 지리공간 알고리즘을 다양한 병렬 아키텍처로 이식할 때 발생하는 성능 저하 요인과 주요 요인을 규명하기 위해.
  • 다중 코어 CPU 및 Intel MIC에서의 벡터 처리 유닛(VPU)이 지리공간 계산을 가속화하는 데 잠재적 잠재력을 탐색하기 위해.
  • 저수준 인트린식 함수를 직접 사용하지 않고도 SIMD 기능을 효율적으로 활용할 수 있는 이식성 있고 확장 가능한 프로그래밍 접근법을 개발하기 위해.
  • 현대적 일반 소비자 하드웨어에서 병렬 지리공간 계산을 위한 실용적인 사례 연구를 제공하기 위해.

제안 방법

  • 데이터 수준 병렬성을 활용하기 위해 점에서 다각형선까지의 최단 거리(P2P) 및 점이 다각형 내부에 있는지 여부(PIP)의 위상 테스트를 위한 데이터 병렬 알고리즘 설계.
  • 이식성을 보장하기 위해 다중 코어 CPU, GPU, Intel MIC 가속기에서 동일한 프로그래밍 인터페이스를 사용하여 알고리즘을 구현.
  • 벡터 처리 유닛(VPU)용 최적화된 코드를 자동 생성하기 위해 도메인 특화 언어(DSL)를 활용하여 수동으로 SIMD 인트린식 코드를 작성하는 것을 피함.
  • 동일한 워크로드에서 다양한 하드웨어 플랫폼에서 성능을 평가하기 위해 실제 대규모 지리공간 데이터 세트를 활용.
  • VPU 활용 여부에 따라 CPU, GPU, MIC 간의 실행 시간과 스피드업을 비교.
  • 전체 성능에 영향을 미치는 메모리 접근 패턴, 데이터 레이아웃, 명령 수준 병렬성의 영향 분석.

실험 결과

연구 질문

  • RQ1실제 대규모 데이터를 사용할 때, 다중 코어 CPU, GPU, Intel MIC 가속기에서 P2P 및 PIP 지리공간 연산의 성능 특성은 어떻게 비교되는가?
  • RQ2CPU 및 MIC 내의 벡터 처리 유닛(VPU)이 지리공간 워크로드에서 전통적인 GPU 가속보다 성능 향상에 얼마나 기여하는가?
  • RQ3데이터 레이아웃, 메모리 접근, 병렬 처리의 세분성과 같은 주요 구현 요소들이 다양한 아키텍처에서 성능에 미치는 영향은 무엇인가?
  • RQ4저수준 인트린식 함수를 사용하지 않고도 지리공간 알고리즘에 대해 이식성 있고 확장 가능한 SIMD 코드 생성을 가능하게 하는 도메인 특화 언어(DSL) 접근법의 효과는 어떠한가?
  • RQ5VPU 최적화된 CPU 및 MIC 구현이 대규모 지리공간 처리에서 GPU 기반 구현을 능가할 수 있는가?

주요 결과

  • VPU 기능을 사용하지 않을 경우, GPU는 P2P 및 PIP 계산에서 다중 코어 CPU보다 뚜렷한 스피드업을 달성한다.
  • 벡터 처리 유닛(VPU)을 활용할 경우, 동일한 지리공간 워크로드에서 다중 코어 CPU 및 Intel MIC는 GPU를 수 배 빠르게 성능을 냈다.
  • DSL 기반 접근법은 저수준 인트린식 코드를 작성하지 않고도 VPU에서 SIMD 명령어를 효과적으로 활용할 수 있게 해주며, 개발 생산성과 코드 유지보수성을 향상시킨다.
  • VPU 활용으로 인한 성능 향상은 매우 크며, 현대 CPU 및 MIC 아키텍처에서 최적의 성능을 달성하는 데 핵심적인 요소로 작용한다.
  • 메모리 접근 패턴과 데이터 레이아웃은 특히 GPU 및 MIC 플랫폼에서 성능에 큰 영향을 미치며, 철저히 최적화되어야 한다.
  • 본 연구는 현대적 일반 소비자 병렬 하드웨어가 VPU 인식 최적화를 통해 적절히 프로그래밍될 경우, 기존 GPU 가속보다 대규모 지리공간 처리에서 뛰어난 성능을 낼 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.