Skip to main content
QUICK REVIEW

[论文解读] GARDENIA: A Domain-specific Benchmark Suite for Next-generation Accelerators

Xu Zhen, Xuhao Chen|arXiv (Cornell University)|Aug 15, 2017
Parallel Computing and Optimization Techniques被引用 4
一句话总结

GARDENIA 是面向下一代加速器的领域特定基准套件,专注于大数据和机器学习中的不规则图分析工作负载。它融合了最先进的 GPU 和 MIC 优化技术,相较于朴素实现最高可提升 3.8× 性能,并揭示了不规则工作负载与结构化工作负载之间显著的微架构差异,凸显了专用加速器设计的必要性。

ABSTRACT

This paper presents the Graph Analytics Repository for Designing Next-generation Accelerators (GARDENIA), a benchmark suite for studying irregular algorithms on massively parallel accelerators. Existing generic benchmarks for accelerators have mainly focused on high performance computing (HPC) applications with limited control and data irregularity, while available graph analytics benchmarks do not apply state-of-the-art algorithms and/or optimization techniques. GARDENIA includes emerging irregular applications in big-data and machine learning domains which mimic massively multithreaded commercial programs running on modern large-scale datacenters. Our characterization shows that GARDENIA exhibits irregular microarchitectural behavior which is quite different from structured workloads and straightforward-implemented graph benchmarks.

研究动机与目标

  • 解决在真实数据中心环境中评估下一代加速器时缺乏真实、不规则基准工作负载的问题。
  • 克服现有通用基准和图专用基准的局限性,这些基准使用过时的算法或缺乏先进优化。
  • 为通用加速器和领域特定加速器研究提供具有代表性、多样化且高度优化的基准套件。
  • 通过准确的微架构表征,支持面向能效的加速器设计。
  • 为硬件、算法、库和编译器设计者提供参考实现,以支持性能比较与优化。

提出的方法

  • 设计一个包含 8 个代表性工作负载的基准套件,涵盖大数据、机器学习和稀疏线性代数领域。
  • 基于规模、密度和拓扑结构选择真实世界的图数据集,以反映现代数据中心工作负载特征。
  • 使用面向大规模并行加速器(GPU 和 MIC)的最先进的优化技术实现所有工作负载。
  • 将优化后的 GARDENIA 实现与直接的 CUDA 版本进行比较,量化优化带来的性能影响。
  • 通过 SIMT 利用率和 IPC 等指标,对多样化工作负载和数据集中的微架构行为进行表征。
  • 在 GPU 和 MIC 平台上评估性能,以评估加速器覆盖范围及平台特异性行为。

实验结果

研究问题

  • RQ1最先进的优化技术如何影响加速器上图分析工作负载的微架构行为与性能?
  • RQ2输入图特征(规模、密度、拓扑结构)在多大程度上影响不规则工作负载的性能与微架构行为?
  • RQ3GPU 和 MIC 加速器在不规则工作负载上的性能与微架构特性有何差异?
  • RQ4为何现有基准套件不足以评估面向真实世界不规则应用的下一代加速器?
  • RQ5未来加速器必须解决的不规则工作负载中的关键性能瓶颈是什么?

主要发现

  • 将最先进的优化技术应用于 GARDENIA 工作负载,相较于直接的 CUDA 实现,性能最高可提升 3.8×。
  • SIMT 利用率和 IPC 随优化显著提升,表明微架构行为发生显著变化。
  • 不同数据集上的性能差异显著:例如,BFS、SSSP 和 BC 在某些图上 IPC 低于 0.1,而 CC、PR、TC 和 SpMV 的 IPC 超过 1.5。
  • 与 CPU 串行实现相比,加速比差异巨大——BFS、SSSP 和 BC 在某些数据集上加速比低于 1.0,表明朴素实现效率低下。
  • MIC 和 GPU 展现出不同的性能趋势:MIC 在 soc-twitter 上 BFS 最高达到 16.0× 加速比,但在 road_central 上仅达 1.2×,凸显平台敏感性。
  • GARDENIA 基准的微架构行为与结构化工作负载及简单图基准存在根本性差异,证明了专用优化基准套件的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。