Skip to main content
QUICK REVIEW

[论文解读] Dwarfs on Accelerators: Enhancing OpenCL Benchmarking for Heterogeneous Computing Architectures

Beau Johnston, Josh Milthorpe|arXiv (Cornell University)|May 10, 2018
Parallel Computing and Optimization Techniques参考文献 21被引用 5
一句话总结

该论文通过提升跨异构架构(包括CPU、GPU和MIC设备)的可移植性、可复现性和可配置性,增强了OpenDwarfs OpenCL基准测试套件。它引入了多种问题规模,用稳健的替代方案取代了有缺陷的基准测试,集成了LibSciBench以实现高精度计时和PAPI性能计数器,并报告了在多种平台上的能效与性能结果,显著提升了HPC工作负载的基准测试可靠性与分析能力。

ABSTRACT

For reasons of both performance and energy efficiency, high-performance computing (HPC) hardware is becoming increasingly heterogeneous. The OpenCL framework supports portable programming across a wide range of computing devices and is gaining influence in programming next-generation accelerators. To characterize the performance of these devices across a range of applications requires a diverse, portable and configurable benchmark suite, and OpenCL is an attractive programming model for this purpose. We present an extended and enhanced version of the OpenDwarfs OpenCL benchmark suite, with a strong focus placed on the robustness of applications, curation of additional benchmarks with an increased emphasis on correctness of results and choice of problem size. Preliminary results and analysis are reported for eight benchmark codes on a diverse set of architectures -- three Intel CPUs, five Nvidia GPUs, six AMD GPUs and a Xeon Phi.

研究动机与目标

  • 解决缺乏稳健、可移植且可配置的基准测试套件以评估异构HPC系统的问题。
  • 提升OpenCL基准测试在包括CPU、GPU和Intel Xeon Phi在内的多样化架构上的可复现性与正确性。
  • 通过新增内核(如来自Rodinia套件的2D离散小波变换)并替换不充分或错误的实现(如原始FFT基准测试),扩展OpenDwarfs基准测试套件。
  • 通过与LibSciBench和PAPI集成,实现高精度性能测量,以准确获取计时、能耗和硬件事件数据。
  • 通过提供一个可靠且可扩展的基准测试框架,支持未来在现代加速器平台上的任务调度与性能可移植性研究。

提出的方法

  • 将OpenDwarfs基准测试套件扩展,新增内核,包括来自Rodinia套件的2D离散小波变换和Bainville(2010)的高性能FFT,替代原始有缺陷的FFT实现。
  • 为每个基准测试启用多种问题规模,基于内存层次结构特性选择,以反映系统特定的性能行为。
  • 修改所有基准测试,使其在循环中运行至少两秒,以减少操作系统噪声并提高计时可复现性。
  • 集成LibSciBench以捕获亚微秒级高分辨率计时数据以及PAPI硬件性能计数器,涵盖内核执行、主机设置和内存传输阶段。
  • 使用PAPI结合Intel RAPL和NVIDIA电源监控技术,收集每个基准测试阶段的能耗数据。
  • 对能耗图表应用对数缩放,以增强对小规模波动(尤其是低于1焦耳)的可见性。

实验结果

研究问题

  • RQ1OpenCL内核在包括CPU、GPU和MIC设备在内的多种异构架构上的性能与能效表现如何变化?
  • RQ2现有基准测试中固定问题规模和平台特定优化在现代硬件上在多大程度上限制了可移植性与正确性?
  • RQ3LibSciBench的集成是否能提升OpenCL基准测试中性能测量的精度、可复现性与可解释性?
  • RQ4不同问题规模如何影响CPU和GPU系统上基准测试的观测性能与能耗特性?
  • RQ5为支持异构HPC环境中可靠的工作负载表征与任务调度,基准测试在鲁棒性与可配置性方面需要哪些改进?

主要发现

  • OpenDwarfs原始FFT基准测试在某些平台和问题规模下失败或返回错误结果,但已成功被Bainville(2010)提供的更稳健、可移植的实现所替代。
  • 所有基准测试现在支持多种问题规模,能够更好地表征内存层次结构的影响,并提升对下一代加速器的可移植性。
  • 在大多数基准测试中,CPU的能耗始终高于GPU,但对低浮点计算强度的内核(如crc)而言,CPU表现更优。
  • CPU上的能耗与执行时间方差更高,与对操作系统和系统噪声更敏感一致,凸显了采用更长、更稳定测量循环的必要性。
  • LibSciBench的集成实现了亚微秒级计时分辨率,并可靠地收集了PAPI性能计数器,显著提升了性能分析的准确性与统计鲁棒性。
  • 增强后的基准测试套件现可在多种设备上实现可靠、可重复且细粒度的性能测量,为未来任务调度与性能可移植性研究奠定了坚实基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。