Skip to main content
QUICK REVIEW

[论文解读] Hardware/Software Co-Programmable Framework for Computational SSDs to Accelerate Deep Learning Service on Large-Scale Graphs

Miryeong Kwon, Donghyun Gouk|arXiv (Cornell University)|Jan 23, 2022
Advanced Graph Neural Networks被引用 7
一句话总结

该论文提出 HolisticGNN,一种软硬件协同可编程框架,通过在基于 FPGA 的计算固态硬盘(CSSD)上直接执行 GNN 工作负载,加速大规模图上的深度学习推理。通过将计算靠近存储位置并支持通过 PCIe 上的图语义库进行直接编程,HolisticGNN 降低了端到端推理延迟和能耗,在现代 GPU 上实现了 7.1 倍的加速和 33.2 倍的能效提升。

ABSTRACT

Graph neural networks (GNNs) process large-scale graphs consisting of a hundred billion edges. In contrast to traditional deep learning, unique behaviors of the emerging GNNs are engaged with a large set of graphs and embedding data on storage, which exhibits complex and irregular preprocessing. We propose a novel deep learning framework on large graphs, HolisticGNN, that provides an easy-to-use, near-storage inference infrastructure for fast, energy-efficient GNN processing. To achieve the best end-to-end latency and high energy efficiency, HolisticGNN allows users to implement various GNN algorithms and directly executes them where the actual data exist in a holistic manner. It also enables RPC over PCIe such that the users can simply program GNNs through a graph semantic library without any knowledge of the underlying hardware or storage configurations. We fabricate HolisticGNN's hardware RTL and implement its software on an FPGA-based computational SSD (CSSD). Our empirical evaluations show that the inference time of HolisticGNN outperforms GNN inference services using high-performance modern GPUs by 7.1x while reducing energy consumption by 33.2x, on average.

研究动机与目标

  • 为解决大规模图上 GNN 推理存在的高延迟和能效低下问题,其中预处理和数据移动占用了大部分运行时间。
  • 通过在计算固态硬盘上实现全编程能力和硬件无关性,克服传统存储内处理(ISP)的局限性。
  • 提供一种无缝、高级别的编程接口,用于 GNN 算法,而无需用户了解底层硬件或存储固件知识。
  • 通过软硬件协同设计,实现从图预处理到推理的端到端、近存储执行的 GNN 工作负载。
  • 证明基于 FPGA 的计算固态硬盘在真实世界 GNN 工作负载中,相较于高端 GPU,可在性能和能效方面实现超越。

提出的方法

  • 设计一种协同可编程框架,用户使用高级图语义库编写 GNN 算法,抽象化硬件细节。
  • 在基于 FPGA 的 CSSD 上实现硬件 RTL,为 GNN 特定操作(如节点采样和嵌入聚合)提供低层可重构加速。
  • 通过 PCIe 支持远程过程调用(RPC),使主机能够直接在 CSSD 上调用 GNN 计算,而无需移动数据。
  • 集成端到端数据处理流水线,实现在存储设备内部的图加载、邻接表构建和嵌入计算。
  • 通过优化 64 个处理单元(PE)的硬件设计,在面积约束和 GNN 推理性能之间实现平衡。
  • 通过存储层的高效更新操作支持可变图工作负载,实现动态图演化。

实验结果

研究问题

  • RQ1在计算固态硬盘上构建的协同可编程框架,是否能显著降低大规模图上 GNN 推理的端到端延迟?
  • RQ2基于 FPGA 的 CSSD 实现的近存储处理,在延迟和能效方面,与基于 GPU 的推理相比,性能提升程度如何?
  • RQ3是否可行提供一种高级别、用户透明的 GNN 编程模型,而无需暴露底层存储或硬件复杂性?
  • RQ4与传统以数据移动为主的处理方式相比,端到端、内存在存储设备中执行的 GNN 流水线(包括预处理、采样和聚合)的效率如何?
  • RQ5该框架能否在保持低延迟性能的同时,高效支持动态图更新(如插入和删除)?

主要发现

  • 与高性能现代 GPU 相比,HolisticGNN 在大规模图工作负载上将端到端推理延迟降低了 7.1 倍。
  • 该框架的能耗比基于 GPU 的推理服务低 33.2 倍,展现出卓越的能效优势。
  • 对于可变图操作,系统实现了平均每日更新延迟为 970 毫秒,最坏情况累计延迟仅为 8.4 秒(占总时间的 0.01%)。
  • 性能提升在多种工作负载中保持一致,包括 chameleon 和 youtube 等高图复杂度场景。
  • 通过在 PCIe 上使用 RPC,实现了无缝集成和高级别编程,用户无需管理底层硬件或固件。
  • 该框架成功在存储设备内部加速了从原始图加载到推理的整个 GNN 流水线,消除了数据移动瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。