Skip to main content
QUICK REVIEW

[논문 리뷰] Dwarfs on Accelerators: Enhancing OpenCL Benchmarking for Heterogeneous Computing Architectures

Beau Johnston, Josh Milthorpe|arXiv (Cornell University)|2018. 05. 10.
Parallel Computing and Optimization Techniques참고 문헌 21인용 수 5
한 줄 요약

이 논문은 CPU, GPU 및 MIC 장치를 포함한 이종 아키텍처에서의 이식성, 재현 가능성 및 구성 가능성을 향상시켜 OpenDwarfs OpenCL 벤치마크 세트를 개선한다. 다양한 문제 크기 도입, 결함이 있는 벤치마크의 안정적인 대체 구현, 고정밀 시간 측정 및 PAPI 성능 카운터를 위한 LibSciBench 통합, 그리고 다양한 플랫폼에서의 에너지 및 성능 결과 보고를 통해 HPC 워크로드에 대한 벤치마크 신뢰성과 분석 능력이 크게 향상된다.

ABSTRACT

For reasons of both performance and energy efficiency, high-performance computing (HPC) hardware is becoming increasingly heterogeneous. The OpenCL framework supports portable programming across a wide range of computing devices and is gaining influence in programming next-generation accelerators. To characterize the performance of these devices across a range of applications requires a diverse, portable and configurable benchmark suite, and OpenCL is an attractive programming model for this purpose. We present an extended and enhanced version of the OpenDwarfs OpenCL benchmark suite, with a strong focus placed on the robustness of applications, curation of additional benchmarks with an increased emphasis on correctness of results and choice of problem size. Preliminary results and analysis are reported for eight benchmark codes on a diverse set of architectures -- three Intel CPUs, five Nvidia GPUs, six AMD GPUs and a Xeon Phi.

연구 동기 및 목표

  • 이종 HPC 시스템을 평가하기 위한 강력하고 이식 가능하며 구성 가능한 벤치마크 세트의 부족을 해결하기 위해.
  • CPU, GPU 및 인텔 Xeon Phi를 포함한 다양한 아키텍처에서 OpenCL 벤치마크의 재현 가능성과 정확성을 향상시키기 위해.
  • 기존의 부적절하거나 잘못 구현된 구현체(예: 원래 FFT 벤치마크)를 대체하기 위해, 2D 이산 웨이블릿 변환과 같은 새로운 커널을 OpenDwarfs 벤치마크 세트에 통합하기 위해.
  • LibSciBench 및 PAPI 통합을 통해 고정밀 성능 측정을 가능하게 하여 정확한 시간 측정, 에너지 소비 및 하드웨어 이벤트 수집을 수행하기 위해.
  • 최신 가속기 플랫폼에서 신뢰할 수 있고 확장 가능한 벤치마크 프레임워크를 제공함으로써 향후 스케줄링 및 성능 이식성 연구를 지원하기 위해.

제안 방법

  • Rodinia 세트에서 유래한 2D 이산 웨이블릿 변환과 Bainville(2010)의 고성능 FFT를 포함한 새로운 커널로 OpenDwarfs 벤치마크 세트를 확장하여 원래 결함이 있는 FFT의 구현을 대체하였다.
  • 메모리 계층의 특성에 기반하여 선택된 다양한 문제 크기를 각 벤치마크에 도입하여 시스템 고유의 성능 행동을 반영하도록 하였다.
  • 모든 벤치마크를 최소 2초 이상 실행되는 루프 내에서 실행하도록 수정하여 운영체제의 잡음 영향을 줄이고 시간 측정의 재현 가능성을 향상시켰다.
  • LibSciBench를 통합하여 고해상도 시간 측정(1마이크로초 이하) 및 커널 실행, 호스트 설정, 메모리 전송 단계의 PAPI 하드웨어 성능 카운터를 캡처하였다.
  • Intel RAPL과 NVIDIA 전력 모니터링을 사용하여 PAPI와 함께 각 벤치마크 단계의 에너지 소비 데이터를 수집하였다.
  • 특히 1J 이하의 작은 변동을 더 잘 시각화하기 위해 에너지 플롯에 로그 스케일링을 적용하였다.

실험 결과

연구 질문

  • RQ1CPU, GPU 및 MIC 장치를 포함한 다양한 이종 아키텍처에서 OpenCL 커널의 성능과 에너지 효율성은 어떻게 달라지나?
  • RQ2기존의 고정된 문제 크기와 플랫폼 특화 최적화가 현대 하드웨어에서의 이식성과 정확성에 얼마나 제한을 가하는가?
  • RQ3LibSciBench 통합이 OpenCL 벤치마킹에서 성능 측정의 정밀도, 재현 가능성 및 해석 가능성에 기여할 수 있는가?
  • RQ4다양한 문제 크기가 CPU 및 GPU 시스템에서의 관측된 성능 및 에너지 특성에 어떻게 영향을 미치는가?
  • RQ5이종 HPC 환경에서 신뢰할 수 있는 워크로드 특성 분석 및 스케줄링을 지원하기 위해 벤치마크의 강건성과 구성 가능성이 어떻게 향상되어야 하는가?

주요 결과

  • OpenDwarfs의 원래 FFT 벤치마크는 특정 플랫폼과 문제 크기에서 실패하거나 잘못된 결과를 반환했으나, Bainville(2010)의 더 강력하고 이식 가능한 구현으로 성공적으로 대체되었다.
  • 모든 벤치마크가 이제 다중 문제 크기를 지원하여 메모리 계층의 영향을 더 잘 특성화하고 향후 세대의 가속기로의 이식 가능성을 향상시켰다.
  • 대부분의 벤치마크에서 CPU의 에너지 소비가 GPU보다 높게 나타났지만, crc와 같은 저float-intensity 커널의 경우 CPU에서 더 우수한 성능를 보였다.
  • CPU에서 에너지 및 실행 시간의 변동성이 더 높았으며, 이는 운영체제 및 시스템 노이즈에 더 민감함을 반영하여, 더 긴 안정적인 측정 루프의 필요성을 강조하였다.
  • LibSciBench 통합을 통해 1마이크로초 이하의 시간 해상도를 확보하고 PAPI 성능 카운터의 신뢰할 수 있는 수집이 가능해져 성능 분석의 정확성과 통계적 강건성이 크게 향상되었다.
  • 향상된 벤치마크 세트는 다양한 장치에서 신뢰할 수 있고 반복 가능하며 세밀한 성능 측정을 지원하며, 향후 스케줄링 및 성능 이식성 연구를 위한 견고한 기반을 마련하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.