[论文解读] AWB-GCN: A Graph Convolutional Network Accelerator with Runtime Workload Rebalancing
AWB-GCN 是一种用于图卷积网络(GCN)推理的硬件加速器,通过运行时工作负载重新平衡技术(包括动态分布平滑、远程切换和行重映射)来解决稀疏、幂律分布图中的极端工作负载不平衡问题。在配备 4K 个处理单元的 FPGA 上评估时,其相对于 CPU 的加速比达到 3,255×,相对于 GPU 的加速比为 80.3×,相对于先前的 FPGA 加速器的加速比为 5.1×。
Deep learning systems have been successfully applied to Euclidean data such as images, video, and audio. In many applications, however, information and their relationships are better expressed with graphs. Graph Convolutional Networks (GCNs) appear to be a promising approach to efficiently learn from graph data structures, having shown advantages in many critical applications. As with other deep learning modalities, hardware acceleration is critical. The challenge is that real-world graphs are often extremely large and unbalanced; this poses significant performance demands and design challenges. In this paper, we propose Autotuning-Workload-Balancing GCN (AWB-GCN) to accelerate GCN inference. To address the issue of workload imbalance in processing real-world graphs, three hardware-based autotuning techniques are proposed: dynamic distribution smoothing, remote switching, and row remapping. In particular, AWB-GCN continuously monitors the sparse graph pattern, dynamically adjusts the workload distribution among a large number of processing elements (up to 4K PEs), and, after converging, reuses the ideal configuration. Evaluation is performed using an Intel D5005 FPGA with five commonly-used datasets. Results show that 4K-PE AWB-GCN can significantly elevate PE utilization by 7.7x on average and demonstrate considerable performance speedups over CPUs (3255x), GPUs (80.3x), and a prior GCN accelerator (5.1x).
研究动机与目标
- 解决现实世界中具有幂律度分布的稀疏图中因极端工作负载不平衡导致的 GCN 推理关键性能瓶颈。
- 克服现有加速器(如 SCNN 和 SIGMA)的局限性——这些加速器依赖全局逐元素控制器,或对超稀疏、不规则的 SpMM 工作负载不适用。
- 设计一种轻量级、可扩展的硬件自动调优框架,通过最小的面积和延迟开销实现动态工作负载重新平衡。
- 在不依赖 FPGA 特定功能的前提下,实现对大规模处理单元阵列(最多 4K 个 PEs)在 FPGA 加速器中用于 GCN 工作负载的高效利用。
- 提供一种通用、可扩展的加速器架构,适用于其他依赖稀疏矩阵乘法(SpMM)的图神经网络(GNN),如 GraphSAGE 和 GINConv。
提出的方法
- 提出三种运行时工作负载重新平衡技术:分布平滑(相邻 PEs 之间的局部负载均衡)、远程切换(全局行级任务迁移)和行重映射(重新分配行以平衡 PEs 利用率)。
- 采用粗粒度、轻量级控制器,实时监控 PEs 间的工作负载分布,并在不平衡超过阈值时触发重新平衡。
- 使用动态分布平滑技术,将非零对在邻近 PEs 之间重新分配,以减少热点,避免全局逐元素控制带来的高成本。
- 通过全局、行级控制器实现远程切换和行重映射,可将整个行或行段重新分配给利用率较低的 PEs,实现大规模负载均衡。
- 集成自动调优机制,学习并重用收敛后的最优工作负载配置,最大限度减少重新配置开销。
- 设计加速器以处理 GCN 中典型的超稀疏矩阵(稀疏度 >99.9%),通过避免预扫描和最小化索引存储开销。
实验结果
研究问题
- RQ1在超稀疏、幂律分布的图上,基于硬件的自动调优如何有效减少 GCN 推理中的工作负载不平衡?
- RQ2在不产生不可接受的面积或延迟开销的前提下,哪些最高效且可扩展的硬件技术可用于在数千个 PEs 上重新平衡 SpMM 工作负载?
- RQ3结合局部与全局重新平衡策略的混合控制器是否能在性能和资源效率方面优于现有全局逐元素控制器?
- RQ4与静态或基于软件的负载均衡相比,运行时工作负载重新平衡在多大程度上能提升 GCN 加速器中 PEs 的利用率和吞吐量?
- RQ5所提出的架构在多种 GCN 工作负载及其他依赖 SpMM 操作的 GNN(如 GraphSAGE 和 GINConv)上的可扩展性如何?
主要发现
- 在 Intel D5005 FPGA 上,AWB-GCN 在五个真实世界 GCN 数据集上实现了平均 7.7× 的 PEs 利用率提升。
- 4K-PE 版本的 AWB-GCN 相对于高端 CPU 实现了 3,255× 的加速比,相对于 GPU 实现了 80.3× 的加速比,相对于先前的 GCN 加速器实现了 5.1× 的加速比。
- 通过分布平滑、远程切换和行重映射实现的运行时工作负载重新平衡,即使在高度不规则、幂律分布的图上也能实现持续的高利用率。
- 基于自动调优的控制器在几乎不增加面积和延迟开销的前提下实现了性能提升,避免了全局逐元素控制器的可扩展性问题。
- 加速器设计具有可移植性,不依赖于 FPGA,可部署于其他硬件平台。
- 由于共享计算原语,该框架可良好扩展至其他依赖 SpMM 操作的 GNN,如 GraphSAGE、GINConv 和 GTN。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。