Skip to main content
QUICK REVIEW

[论文解读] Bulk-synchronous pseudo-streaming algorithms for many-core accelerators

Jan‐Willem Buurlage, Tom Bannink|arXiv (Cornell University)|Aug 25, 2016
Parallel Computing and Optimization Techniques参考文献 14被引用 13
一句话总结

本文提出了一种面向本地内存受限的多核协处理器的广义BSP模型——批量同步伪流式计算(BSPS)。该模型扩展了经典BSP成本函数,以预测性能并识别瓶颈,通过在Parallella开发板上实现Cannon算法进行了验证,结果表明其能够准确预测运行时间,并通过超步分析实现有效的负载均衡。

ABSTRACT

The bulk-synchronous parallel (BSP) model provides a framework for writing parallel programs with predictable performance. In this paper we extend the BSP model to support what we will call pseudo-streaming algorithms for accelerators. We also generalize the BSP cost function to these algorithms, so that it is possible to predict the running time for programs targeting many-core accelerators and to identify possible bottlenecks. Several examples of algorithms within this new framework will be explored. We extend the BSPlib standard by proposing a small number of new BSP primitives to create and use streams in a portable way. We will introduce a software library called Epiphany BSP that implements these ideas for the Parallella development board. Finally we will give experimental results for pseudo-streaming algorithms on the Parallella platform.

研究动机与目标

  • 为本地内存受限的多核协处理器上的BSP算法填补性能预测的空白。
  • 扩展经典BSP模型,以处理现代多核协处理器中固有的流式约束。
  • 在面向此类系统的并行程序中实现准确的运行时间预测与瓶颈识别。
  • 通过向BSPlib进行最小化扩展并引入新的软件库Epiphany BSP,确保可移植性与标准化。
  • 通过在Parallella平台上的真实应用实现与实验测量,验证该框架。

提出的方法

  • 提出批量同步伪流式计算(BSPS)作为BSP模型的扩展,将流式约束整合进超步抽象中。
  • 将BSP成本函数泛化,以包含通信量与同步开销,使用从硬件测量中获得的参数 $ l $(延迟)和 $ g $(反带宽)进行建模。
  • 引入超步概念,其中 $ k = n / (N M) $,用于平衡计算与通信,$ k_{\text{equal}} \approx 8 $ 标识通信与计算密集阶段之间的转换点。
  • 定义新的成本函数:$ T = \sum_{i=0}^{k-1} \left( \max_s w_i^{(s)} + g h_i + l \right) $,其中 $ h_i $ 表示在超步 $ i $ 中每个处理器的最大通信量。
  • 开发Epiphany BSP库,用于在Parallella开发板上实现BSPS原语,通过向BSPlib添加最小化、可移植的扩展实现。
  • 采用硬件时钟校准技术,以隔离真实的通信与同步开销,获得 $ l \approx 136~\text{FLOP} $ 与 $ g \approx 5.59~\text{FLOP/float} $。

实验结果

研究问题

  • RQ1如何扩展BSP模型,以支持在本地内存受限的多核协处理器上高效执行?
  • RQ2能否为BSPS算法推导出一个广义成本函数,以准确预测运行时间并识别性能瓶颈?
  • RQ3超步参数 $ k $ 在多大程度上能够实现BSPS算法中计算与通信之间的有效负载均衡?
  • RQ4如何使BSPS在不同多核平台之间实现可移植性与互操作性?
  • RQ5BSPS框架能否有效应用于真实HPC工作负载,如密集矩阵乘法?

主要发现

  • BSPS成本函数成功预测了Cannon算法在Epiphany-III处理器上的运行时间行为,实验结果与理论预测高度吻合。
  • 通信密集与计算密集超步之间的转换点出现在 $ k_{\text{equal}} \approx 8 $,与实验中观察到的性能趋势一致。
  • 测得的延迟 $ l \approx 136~\text{FLOP} $ 与反带宽 $ g \approx 5.59~\text{FLOP/float} $ 提供了性能建模所需的准确硬件成本参数。
  • Epiphany BSP库实现了在Parallella平台上的BSPS算法可移植实现,证明了该框架的可行性。
  • 该框架可扩展至其他领域,包括实时视频处理与稀疏矩阵运算,表明其在大数据与HPC领域的广泛应用潜力。
  • 通过在不同矩阵尺寸与分块大小下,理论成本分析与实测执行时间的一致性,验证了该模型的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。