[论文解读] Automatic Horizontal Fusion for GPU Kernels
本文提出自动水平融合(automatic horizontal fusion),一种新颖的CUDA编译器优化技术,通过将来自不同内核的线程共置在单个融合内核中,提升线程级并行性以隐藏指令延迟。所提出的源到源编译器HFuse自动划分线程ID并插入分支条件以引导执行,相较于原生内核最高可实现60.8%的加速,尤其在内存与计算密集型混合资源内核中表现显著。
We present automatic horizontal fusion, a novel optimization technique that complements the standard kernel fusion techniques for GPU programs. Unlike the standard fusion, whose goal is to eliminate intermediate data round trips, our horizontal fusion technique aims to increase the thread-level parallelism to hide instruction latencies. We also present HFuse, a new source to source CUDA compiler that implements automatic horizontal fusion. Our experimental results show that horizontal fusion can speed up the running time by 2.5%-60.8%. Our results reveal that the horizontal fusion is especially beneficial for fusing kernels with instructions that require different kinds of GPU resources (e.g., a memory-intensive kernel and a compute-intensive kernel).
研究动机与目标
- 解决由指令级延迟引起的GPU内核性能瓶颈,特别是在标准垂直融合无效的情况下。
- 克服垂直内核融合的局限性,后者虽可消除内存往返开销,但无法提升线程级并行性。
- 实现具有异构资源需求(如内存密集型与计算密集型)的内核的自动融合,以更高效地利用GPU硬件。
- 开发一个源到源编译器(HFuse),自动处理水平融合中的线程空间划分与同步屏障。
- 通过共置异构内核线程,利用warp调度器的交错执行能力,提升整体内核吞吐量。
提出的方法
- 根据线程ID将融合内核的线程块划分为两个区间,分别分配给原始内核之一。
- 在融合内核中插入条件分支,根据线程ID将每个线程引导至对应内核的指令序列。
- 使用内联PTX汇编和带仪器化的分支条件,实现仅影响特定内核的同步屏障,避免阻塞无关线程。
- 应用自动性能分析技术,探索并识别最优的线程空间划分方案以提升性能。
- 将水平融合技术集成至一个源到源CUDA编译器(HFuse)中,生成功能等价且优化的内核。
- 通过分析融合过程中的寄存器与共享内存使用情况,平衡线程级与块级并行性。
实验结果
研究问题
- RQ1通过提升线程级并行性和隐藏指令延迟,水平融合是否能超越垂直融合实现性能提升?
- RQ2在水平融合的内核中,如何安全处理来自一个原始内核的同步屏障,而不会阻塞无关线程?
- RQ3为最大化性能,水平融合内核的最优线程空间划分策略是什么?
- RQ4对于具有混合硬件资源需求(如内存与计算)的内核,水平融合是否能带来可测量的加速?
- RQ5在真实工作负载(如深度学习和加密货币挖矿)中,自动水平融合是否能超越原生内核和垂直融合内核的性能表现?
主要发现
- HFuse在1080Ti和V100 GPU上相较于原生内核最高实现60.8%的加速,其中在1080Ti上16对中的7对、在V100上16对中的6对均优于原生和垂直融合内核。
- 水平融合在融合不同资源强度的内核(如内存密集型与计算密集型)时尤为有效,得益于对GPU执行单元的更好利用。
- 性能提升主要源于warp调度器能够交错执行来自不同内核的指令,从而有效隐藏指令级延迟。
- 通过性能分析实现的自动线程划分显著提升了性能,因为次优划分会因寄存器和共享内存压力增加而降低性能。
- 在垂直融合无优势的场景(如内存流量非瓶颈时),水平融合仍表现更优,证明其与垂直融合具有互补性。
- 研究揭示了线程级与块级并行性之间的权衡:虽然水平融合提升了线程级并行性,但也增加了寄存器与共享内存使用,需谨慎优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。