Skip to main content
QUICK REVIEW

[논문 리뷰] Bulk-synchronous pseudo-streaming algorithms for many-core accelerators

Jan‐Willem Buurlage, Tom Bannink|arXiv (Cornell University)|2016. 08. 25.
Parallel Computing and Optimization Techniques참고 문헌 14인용 수 13
한 줄 요약

이 논문은 국소 메모리가 제한된 다수의 코프로세서를 위한 최적화된 일반화된 BSP 모델인 블록-동기 가짜 스트리밍(Bulk-Synchronous Pseudo-Streaming, BSPS)을 소개한다. 고전적인 BSP 비용 함수를 확장하여 성능 예측 및 버블넥 식별을 가능하게 하였으며, Parallella 보드에서 캐논 알고리즘의 구현을 통해 검증되었으며, 정확한 런타임 예측과 효율적인 로드 밸런싱이 가능한 초단계 분석을 통한 성능 향상을 보였다.

ABSTRACT

The bulk-synchronous parallel (BSP) model provides a framework for writing parallel programs with predictable performance. In this paper we extend the BSP model to support what we will call pseudo-streaming algorithms for accelerators. We also generalize the BSP cost function to these algorithms, so that it is possible to predict the running time for programs targeting many-core accelerators and to identify possible bottlenecks. Several examples of algorithms within this new framework will be explored. We extend the BSPlib standard by proposing a small number of new BSP primitives to create and use streams in a portable way. We will introduce a software library called Epiphany BSP that implements these ideas for the Parallella development board. Finally we will give experimental results for pseudo-streaming algorithms on the Parallella platform.

연구 동기 및 목표

  • 국소 메모리가 제한된 다수의 코프로세서에서 BSP 알고리즘의 성능 예측 격차를 해소하기 위해.
  • 현대의 다수 코어 가속기에서 내재된 스트리밍 유사 제약 조건을 처리할 수 있도록 고전적 BSP 모델을 확장하기 위해.
  • 이러한 시스템을 대상으로 하는 병렬 프로그램의 정확한 런타임 예측 및 성능 저하 원인 식별을 가능하게 하기 위해.
  • BSPlib에 최소한의 확장을 통해 이식성과 표준화를 보장하기 위해.
  • Parallella 플랫폼에서의 실제 구현 및 실험 측정을 통해 프레임워크를 검증하기 위해.

제안 방법

  • 블록-동기 가짜 스트리밍(BSPS)을 제안하며, 초단계 추상화에 스트리밍 제약 조건을 통합한다.
  • 통신 볼륨과 동기화 오버헤드를 포함하도록 BSP 비용 함수를 일반화하며, 하드웨어 측정에서 유도된 매개변수 $ l $ (지연 시간)과 $ g $ (역대역폭)를 사용한다.
  • 초단계 $ k = n / (N M) $ 를 통해 계산과 통신의 균형을 맞추는 초단계(hyperstep) 개념을 도입하며, $ k_{\text{equal}} \approx 8 $ 는 통신 중심과 계산 중심 단계 간의 전환 지점을 나타낸다.
  • 새로운 비용 함수 정의: $ T = \sum_{i=0}^{k-1} \left( \max_s w_i^{(s)} + g h_i + l \right) $, 여기서 $ h_i $ 는 초단계 $ i $ 에서 프로세서당 최대 통신 볼륨이다.
  • Parallella 보드에서 BSPS 원리를 실행하기 위해 BSPlib에 최소한의 이식 가능한 추가 기능을 제공하는 Epiphany BSP 라이브러리를 개발한다.
  • 하드웨어 클럭 캘리브레이션을 활용하여 진정한 통신 및 동기화 비용을 분리하며, $ l \approx 136~\text{FLOP} $ 와 $ g \approx 5.59~\text{FLOP/float} $ 를 도출한다.

실험 결과

연구 질문

  • RQ1국소 메모리가 제한된 다수의 코프로세서에서 효율적인 실행을 위해 BSP 모델을 어떻게 확장할 수 있는가?
  • RQ2BSPS 알고리즘에 대해 정확한 런타임 예측과 성능 저하 원인 식별이 가능한 일반화된 비용 함수를 유도할 수 있는가?
  • RQ3초단계 매개변수 $ k $ 가 BSPS 알고리즘에서 계산과 통신 간의 효과적인 로드 밸런싱을 얼마나 잘 가능하게 하는가?
  • RQ4BSPS는 다양한 다수 코어 플랫폼 간 이식성과 상호 운용성을 어떻게 확보할 수 있는가?
  • RQ5BSPS 프레임워크는 밀도 높은 행렬 곱셈과 같은 실제 HPC 워크로드에 효과적으로 적용될 수 있는가?

주요 결과

  • BSPS 비용 함수는 Epiphany-III 프로세서에서 캐논 알고리즘의 런타임 행동을 정확하게 예측하며, 실험 결과가 이론적 예측과 밀도 있게 일치한다.
  • 통신 중심과 계산 중심 초단계 간의 전환 지점은 $ k_{\text{equal}} \approx 8 $ 에서 발생하며, 이는 실험에서 관측된 성능 추세와 일치한다.
  • 측정된 지연 시간 $ l \approx 136~\text{FLOP} $ 와 역대역폭 $ g \approx 5.59~\text{FLOP/float} $ 는 성능 모델링을 위한 정확한 하드웨어 비용 매개변수를 제공한다.
  • Epiphany BSP 라이브러리는 Parallella 플랫폼에서 BSPS 알고리즘의 이식 가능한 구현을 가능하게 하며, 프레임워크의 실현 가능성을 입증한다.
  • 프레임워크는 실시간 영상 처리 및 희소 행렬 연산과 같은 다른 영역으로도 확장 가능하며, 빅데이터 및 HPC 분야에서 넓은 적용 가능성을 시사한다.
  • 이론적 비용 분석과 측정된 실행 시간 간의 일관성 있는 일치는 모델의 정확성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.