[论文解读] Centaur: A Chiplet-based, Hybrid Sparse-Dense Accelerator for Personalized Recommendations
Centaur 是一种基于小芯片的混合FPGA加速器,通过协同优化个性化推荐系统中的稀疏嵌入与密集MLP工作负载,实现了性能提升。通过在CPU+FPGA封装中集成用于嵌入查找的稀疏加速器和用于密集GEMM计算的加速器,Centaur在Intel HARPv2平台上相比纯CPU推理实现了1.7–17.2×的加速比和1.7–19.5×的能效提升。
Personalized recommendations are the backbone machine learning (ML) algorithm that powers several important application domains (e.g., ads, e-commerce, etc) serviced from cloud datacenters. Sparse embedding layers are a crucial building block in designing recommendations yet little attention has been paid in properly accelerating this important ML algorithm. This paper first provides a detailed workload characterization on personalized recommendations and identifies two significant performance limiters: memory-intensive embedding layers and compute-intensive multi-layer perceptron (MLP) layers. We then present Centaur, a chiplet-based hybrid sparse-dense accelerator that addresses both the memory throughput challenges of embedding layers and the compute limitations of MLP layers. We implement and demonstrate our proposal on an Intel HARPv2, a package-integrated CPU+FPGA device, which shows a 1.7-17.2x performance speedup and 1.7-19.5x energy-efficiency improvement than conventional approaches.
研究动机与目标
- 解决个性化推荐工作负载中内存密集型稀疏嵌入层带来的日益严重的性能瓶颈问题。
- 克服纯CPU推理的局限性,后者在嵌入层和MLP层上面临内存带宽利用率低和计算吞吐量差的问题。
- 设计一种端到端的系统级加速器,协同优化推荐模型中的稀疏与密集DNN组件。
- 通过采用封装集成的CPU+FPGA技术,实现与现有数据中心基础设施的无缝集成,无需修改系统或软件栈。
- 在不依赖专用内存架构或ISA修改的前提下,为生产规模的推荐模型实现高性能和高能效。
提出的方法
- 利用封装集成的CPU+FPGA硬件(Intel HARPv2),实现CPU与FPGA之间的高带宽、低延迟通信。
- 设计专用稀疏加速器,以高内存级并行性高效处理不规则、低局部性的嵌入收集操作。
- 在FPGA上实现高吞吐量的密集GEMM加速器,以高效处理计算密集型的多层感知机(MLP)层。
- 采用小芯片架构,实现在单一封装内对不同工作负载的专用加速器进行可扩展、模块化的集成。
- 优化数据流与内存访问模式,最小化稀疏与密集工作负载的延迟,并最大化带宽利用率。
- 通过避免对CPU ISA、运行时或系统软件的修改,确保与现有软件栈和服务器硬件的兼容性。
实验结果
研究问题
- RQ1在以CPU为中心的推荐推理系统中,如何有效缓解稀疏嵌入层的内存带宽限制?
- RQ2基于FPGA的硬件加速在多大程度上能够提升推荐模型中稀疏与密集组件的性能和能效?
- RQ3基于小芯片的CPU+FPGA架构是否能够提供足够的带宽和足够低的延迟,以实现对嵌入和MLP工作负载的有效卸载?
- RQ4在真实世界推荐工作负载中,混合稀疏-密集加速器的性能与效率与传统纯CPU推理相比如何?
- RQ5在不破坏现有数据中心基础设施的前提下,设计一种协同加速稀疏与密集DNN组件的系统时,关键的架构权衡是什么?
主要发现
- 在生产级推荐模型中,稀疏嵌入层占推理时间的高达79%,是纯CPU系统中的主要性能瓶颈。
- CPU内存系统由于嵌入查找的不规则访问模式,导致高缓存未命中率和内存带宽利用率低下。
- Centaur加速器在Intel HARPv2平台上相比纯CPU推理实现了1.7–17.2×的加速比,展现出显著的性能提升。
- 与纯CPU系统相比,Centaur在能效方面实现了1.7–19.5×的改进,凸显其在ML推理中的高能效特性。
- 基于小芯片的FPGA设计实现了CPU与加速器之间的高带宽、低延迟通信,这对维持高吞吐量至关重要。
- Centaur对现有软件和硬件栈完全透明,可在无需系统修改的情况下实现即插即用的部署,适用于当前数据中心环境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。