[论文解读] A Survey on Hardware Accelerators for Large Language Models
本综述对大型语言模型(LLMs)的硬件加速器进行了全面分析,评估了GPU、FPGA、ASIC及内存内计算架构。研究发现,ASIC与内存内加速器相较于CPU可实现最高347倍的加速比和四个数量级更高的能效,而FPGA则提供了实用且可重构的替代方案,具有较低但依然显著的性能提升。
Large Language Models (LLMs) have emerged as powerful tools for natural language processing tasks, revolutionizing the field with their ability to understand and generate human-like text. As the demand for more sophisticated LLMs continues to grow, there is a pressing need to address the computational challenges associated with their scale and complexity. This paper presents a comprehensive survey on hardware accelerators designed to enhance the performance and energy efficiency of Large Language Models. By examining a diverse range of accelerators, including GPUs, FPGAs, and custom-designed architectures, we explore the landscape of hardware solutions tailored to meet the unique computational demands of LLMs. The survey encompasses an in-depth analysis of architecture, performance metrics, and energy efficiency considerations, providing valuable insights for researchers, engineers, and decision-makers aiming to optimize the deployment of LLMs in real-world applications.
研究动机与目标
- 应对数据中心中日益庞大且复杂的LLMs所带来的计算与能耗增长挑战。
- 系统性评估专为Transformer中最耗算力的操作(如矩阵乘法)量身定制的硬件加速器。
- 对包括GPU、FPGA、ASIC与内存内架构在内的多种平台,进行性能、加速比与能效的对比分析。
- 识别在实际部署场景中,定制化加速器(如ASIC)与可重构平台(如FPGA)之间的权衡。
- 基于性能、成本与能效,为研究人员和工程师提供选择最优硬件解决方案以实现高效LLM部署的指导。
提出的方法
- 对240余篇关于LLM硬件加速器的研究工作进行全面调研,重点关注基于Transformer的模型。
- 按技术类型(GPU、FPGA、ASIC、内存内)对加速器进行分类,并基于加速比、能效与实现可行性进行评估。
- 使用周期精确的仿真与功耗估算工具(如CACTI)评估ASIC与内存内设计,即使未实际制造也进行评估。
- 将加速器与多种参考平台(CPU、GPU)进行对比,以评估相对性能,同时承认基线配置的差异性。
- 分析集成到加速器设计中的算法优化技术,如稀疏性、量化与低精度计算,以提升效率。
- 评估关键框架(如MNNFast)在多平台(CPU、GPU、FPGA)上的实现,以展示跨平台的一致性与可移植性。

实验结果
研究问题
- RQ1GPU、FPGA、ASIC与内存内计算加速器在LLM推理中的关键架构与性能差异是什么?
- RQ2与通用CPU和GPU相比,硬件加速器如何提升基于Transformer的LLMs的加速比与能效?
- RQ3在加速LLMs方面,定制ASIC(高性能、高成本)与可重构FPGA(较低性能、更快部署)之间的权衡是什么?
- RQ4在硬件加速器中,算法优化(如稀疏性、量化)能在多大程度上被利用以提升能效?
- RQ5新兴技术(如基于NVM与忆阻器的内存内计算)在LLM加速中面临哪些实际限制与商业化障碍?
主要发现
- 基于ASIC的加速器相较于CPU参考平台最高可实现347倍的加速比,其中SpAtten报告了最高的加速比。
- 内存内计算加速器最高可实现200倍的加速比,且相比CPU的能效提升达四个数量级,MNNFast展示了跨平台的一致性。
- 基于FPGA的加速器(如FTrans)最高可实现81倍的加速比,提供了一种实用且可重构的替代方案,具有较低的前期成本与更快的部署速度。
- ASIC与内存内加速器相较于CPU可将能耗降低高达四个数量级,相较于GPU(如V100)可降低三个数量级,显著降低了碳排放与散热需求。
- 尽管性能优异,ASIC与内存内解决方案仍面临较长的开发周期与高昂的制造成本,限制了其广泛应用。
- FPGA提供了一个切实可行的折中方案——在实现显著加速比与能效提升的同时,支持快速原型设计,并可无缝集成至现有数据中心基础设施中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。