Skip to main content
QUICK REVIEW

[论文解读] AI and ML Accelerator Survey and Trends

Albert Reuther, Peter Michaleas|arXiv (Cornell University)|Oct 8, 2022
Advanced Memory and Neural Computing被引用 4
一句话总结

本文综述了过去三年内公开发布的AI与机器学习加速器,重点关注包括DNN/CNN推理处理器、脉冲神经网络芯片(如Loihi)、光子处理器和阻变存储器基础系统在内的多种架构的峰值性能与能效表现。文章展示了性能与功耗的更新版散点图,识别出加速器设计的新兴趋势,并分析了面向嵌入式与数据中心应用的计算效率权衡。

ABSTRACT

This paper updates the survey of AI accelerators and processors from past three years. This paper collects and summarizes the current commercial accelerators that have been publicly announced with peak performance and power consumption numbers. The performance and power values are plotted on a scatter graph, and a number of dimensions and observations from the trends on this plot are again discussed and analyzed. Two new trends plots based on accelerator release dates are included in this year's paper, along with the additional trends of some neuromorphic, photonic, and memristor-based inference accelerators.

研究动机与目标

  • 提供一份全面且最新的公开AI与机器学习加速器调研,涵盖实测峰值性能与功耗数据。
  • 分析加速器设计趋势,尤其聚焦于低功耗嵌入式系统与高性能数据中心的推理工作负载。
  • 评估新兴非传统加速器技术,如脉冲神经网络、光子与阻变存储器基础处理器。
  • 比较不同精度格式(int8、bfloat16、fp16)与架构方法在计算效率上的表现差异。
  • 通过识别适用于尺寸、重量与功耗受限环境的加速器,支持国防与国家安全部署需求。

提出的方法

  • 收集并整理了2020至2023年间发布的150余款AI加速器的公开性能与功耗数据。
  • 绘制峰值性能(TOPS)与功耗(W)的散点图,以可视化各类加速器在性能-功耗之间的权衡关系。
  • 按应用领域(边缘、数据中心、嵌入式)与技术类型(GPU、TPU、FPGA、脉冲神经网络、光子、阻变存储器)对加速器进行分组。
  • 基于加速器发布日期的时间顺序散点图,分析趋势,追踪性能与效率的演变过程。
  • 评估混合精度推理(int8、bfloat16、fp16)的支持情况,并分析其对计算吞吐量的影响。
  • 包含案例研究与对新兴技术的引用,如Loihi(脉冲神经网络)、光子协处理器与Knowm阻变存储器。

实验结果

研究问题

  • RQ1当前AI加速器在深度神经网络推理方面的性能与能效趋势如何?
  • RQ2与传统GPU和TPU架构相比,脉冲神经网络、光子与阻变存储器基础加速器在性能与能效方面表现如何?
  • RQ3在不同应用场景(边缘与数据中心)中,现代AI加速器的主要设计权衡因素是什么?
  • RQ4过去三年中,AI加速器的开发周期如何演变?哪些因素影响其上市时间?
  • RQ5混合精度格式(int8、bfloat16)在决定AI加速器计算效率方面发挥何种作用?

主要发现

  • 如Loihi 2等脉冲神经网络加速器在脉冲神经网络推理中表现出超低功耗(低于100 mW),可在功耗受限环境中实现实时处理。
  • 光子加速器(如采用硅光子学与傅里叶光学技术)在特定运算(如卷积与矩阵乘法)中,理论性能可比GPU高出100倍。
  • 阻变存储器基础加速器在内存内计算方面展现出潜力,Knowm设备在概念验证研究中实现了亚微秒级开关速度与低每操作能耗。
  • 过去三年中,现代AI加速器的每瓦性能提升了2.5至3倍,许多新型芯片在int8推理中实现了>100 TOPS/W的能效表现。
  • 基于数据流架构的加速器(如MIT的Eyeriss)在CNN推理中表现出卓越的能效,尤其适用于边缘应用场景。
  • 尽管已有进展,新加速器的开发周期依然较长——通常为2至4年,表明持续的研发投入对推动创新至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。