[论文解读] Reordering GPU Kernel Launches to Enable Efficient Concurrent Execution
该论文提出了一种内核启动重排序技术,通过优化独立内核的启动顺序,在不修改内核的前提下最大化GPU上的并发执行。通过在各次执行轮次中平衡资源利用率(寄存器、共享内存、线程束)和指令/内存比,该方法实现了接近最优的性能表现——在排列空间中排名超过第94.8百分位,相较于最差顺序的启动方式,最高可实现5.185倍的加速。
Contemporary GPUs allow concurrent execution of small computational kernels in order to prevent idling of GPU resources. Despite the potential concurrency between independent kernels, the order in which kernels are issued to the GPU will significantly influence the application performance. A technique for deriving suitable kernel launch orders is therefore presented, with the aim of reducing the total execution time. Experimental results indicate that the proposed method yields solutions that are well above the 90 percentile mark in the design space of all possible permutations of the kernel launch sequences.
研究动机与目标
- 解决尽管硬件支持内核并发执行,但因内核启动顺序不佳导致的性能下降问题。
- 克服CUDA流中非可交换并发引发的虚假依赖与资源利用率不足问题。
- 设计一种调度算法,通过重排内核启动顺序,以最大化SM资源利用率并最小化执行轮次。
- 通过在每次执行轮次中平衡各内核的计算与内存访问比率(Inst/Mem),改善整体GPU执行时间。
- 提供一种与内核无关的解决方案,无需修改源代码或转换内核。
提出的方法
- 分析内核性能剖析数据(N_tblk_i, N_reg_i, N_shm_i, N_warp_i, R_i),计算每个内核的资源与平衡度量指标。
- 使用评分矩阵根据内核对在每次执行轮次中对资源利用率和R_comb(组合指令/内存比)的综合影响对内核对进行排序。
- 应用贪心算法,按顺序将内核分配至执行轮次,优先选择能最大化资源利用率与平衡度的组合。
- 确保每次执行轮次均遵守SM资源限制(N_reg_SM, N_shm_SM, N_warp_SM, N_blk_SM),仅在资源耗尽时才开启新轮次。
- 计算每轮的组合R_comb为:R_comb = 总指令数 / (4 × (全局存储写入数 + L1缓存加载缺失数))。
- 通过迭代方式构建内核序列,每次选择当前轮次中得分最高的内核,直至所有内核均被调度。
实验结果
研究问题
- RQ1当多个独立内核被调度到同一GPU上时,内核启动顺序如何影响GPU执行时间?
- RQ2通过平衡SM资源利用率与内存/计算比率,重排序内核启动序列能在多大程度上提升并发执行性能?
- RQ3一种与内核无关的重排序策略是否能在不修改内核代码的前提下,优于随机或朴素的排序方式?
- RQ4基于启发式的启动重排序算法在多样化GPU工作负载下,与最优排列相比,执行时间的接近程度如何?
- RQ5共享内存大小、网格尺寸和块尺寸的变化对启动重排序效果有何影响?
主要发现
- 在EpBsEsSw-8实验中,所提算法在全部40,320种排列中达到中位数94.8百分位排名,表现出接近最优的行为。
- 在包含8个来自4个不同应用程序的内核的EpBsEsSw-8工作负载中,该算法相较于最差启动顺序实现了5.185倍的加速。
- 在EP-6-shm实验中,该算法达到91.5百分位排名,仅与最优执行时间相差4.21%。
- 该算法始终优于随机排序,有50%的概率实现至少16.1%的性能提升。
- 在所有六个基准实验中,该方法均达到96.5%或更高的百分位排名,包括共享内存、网格尺寸和块尺寸的变化情况。
- 该方法仅在内核非完全相同且资源约束(如寄存器、共享内存)引发竞争时才有效;否则,启动顺序不会产生影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。