[论文解读] Performance Analysis and Efficient Execution on Systems with multi-core CPUs, GPUs and MICs
本文提出两种性能感知调度策略——PADAS 和 PAMS,用于包含 CPU、GPU 和英特尔至强融核(MIC)加速器的混合系统,目标为图像分析工作负载。通过基于数据访问模式和计算强度对不同设备上的操作性能变化进行建模,作者证明 PAMS 在执行时间预测存在估计误差的情况下,相较于 HEFT 和 FCFS,至少可将应用性能提升 1.15 倍。
We carry out a comparative performance study of multi-core CPUs, GPUs and Intel Xeon Phi (Many Integrated Core - MIC) with a microscopy image analysis application. We experimentally evaluate the performance of computing devices on core operations of the application. We correlate the observed performance with the characteristics of computing devices and data access patterns, computation complexities, and parallelization forms of the operations. The results show a significant variability in the performance of operations with respect to the device used. The performances of operations with regular data access are comparable or sometimes better on a MIC than that on a GPU. GPUs are more efficient than MICs for operations that access data irregularly, because of the lower bandwidth of the MIC for random data accesses. We propose new performance-aware scheduling strategies that consider variabilities in operation speedups. Our scheduling strategies significantly improve application performance compared to classic strategies in hybrid configurations.
研究动机与目标
- 分析并比较多核 CPU、GPU 和英特尔至强融核(MIC)加速器在显微镜图像分析中常见操作上的性能表现。
- 识别数据访问模式(规则与非规则)、计算强度及并行化策略对不同加速器上性能的影响。
- 设计考虑操作与设备间性能差异的调度策略,以提升混合配置下的执行效率。
- 评估这些策略在配备异构加速器的分布式内存集群中的有效性。
提出的方法
- 使用真实硬件对图像分析流水线中的核心操作在 CPU、GPU 和 MIC 上进行实验性性能评估。
- 将观测到的性能与设备特性、数据访问模式、计算复杂度及并行化形式进行关联。
- 基于性能感知的任务分配,设计两种新型调度策略——PADAS 和 PAMS,考虑操作加速比和设备特定的性能波动。
- 在配备 CPU、GPU 和 MIC 的分布式内存集群上实现并评估这些策略。
- 利用微内核测量和真实应用工作负载校准性能模型,以支持调度决策。
- 在执行时间输入存在不同程度估计误差的情况下,将所提策略(PADAS、PAMS)与经典策略(FCFS 和 HEFT)进行对比。
实验结果
研究问题
- RQ1在图像分析流水线中,对于具有规则与非规则数据访问模式的操作,GPU、CPU 和 MIC 的性能表现如何比较?
- RQ2计算强度与并行化策略对不同加速器类型上操作性能的影响是什么?
- RQ3操作间性能波动如何影响混合 CPU-加速器系统中任务调度的效率?
- RQ4与传统调度策略(如 FCFS 和 HEFT)相比,性能感知调度策略是否能显著提升应用执行时间?
- RQ5性能感知调度器在操作执行时间估计不准确时是否仍具备鲁棒性?
主要发现
- 由于随机访问具有更高的内存带宽,GPU 在具有非规则数据访问和大量原子操作的操作中优于 MIC。
- 在具有规则数据访问模式和高数据级并行性的操作中,MIC 的性能与 GPU 相当或更优。
- 由于数据访问与计算模式的差异,操作间存在显著的性能波动,因此需要设备感知的调度策略。
- 在包含 CPU、GPU 和 MIC 的混合配置中,PAMS 调度策略相比其最接近的竞争对手(HEFT)至少实现了 1.15 倍的加速。
- 性能感知调度器(PADAS 和 PAMS)即使在操作执行时间估计误差较大的情况下仍保持鲁棒性,而 HEFT 则因输入不准确而性能显著下降。
- 所提方法通过 CPU 与加速器的协同使用,实现了在分布式内存环境中的良好可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。