[论文解读] An Evaluation of Edge TPU Accelerators for Convolutional Neural Networks
本文在 423,000 个卷积神经网络上评估了三类边缘 TPU 加速器,揭示了基于模型结构和加速器配置的微架构性能权衡洞察。该研究提出了一种基于图神经网络的可学习模型,其延迟和能耗估计精度达到约 97%,与周期精确仿真器的等级相关性超过 99%,从而实现了硬件/软件协同设计的快速实现。
Edge TPUs are a domain of accelerators for low-power, edge devices and are widely used in various Google products such as Coral and Pixel devices. In this paper, we first discuss the major microarchitectural details of Edge TPUs. Then, we extensively evaluate three classes of Edge TPUs, covering different computing ecosystems, that are either currently deployed in Google products or are the product pipeline, across 423K unique convolutional neural networks. Building upon this extensive study, we discuss critical and interpretable microarchitectural insights about the studied classes of Edge TPUs. Mainly, we discuss how Edge TPU accelerators perform across convolutional neural networks with different structures. Finally, we present our ongoing efforts in developing high-accuracy learned machine learning models to estimate the major performance metrics of accelerators such as latency and energy consumption. These learned models enable significantly faster (in the order of milliseconds) evaluations of accelerators as an alternative to time-consuming cycle-accurate simulators and establish an exciting opportunity for rapid hard-ware/software co-design.
研究动机与目标
- 在具有不同架构的 423,000 个卷积神经网络上,评估三类不同边缘 TPU 加速器的性能。
- 提取可解释的微架构洞察,揭示边缘 TPU 性能如何随模型大小、操作类型(如 3×3 卷积)和参数数量而变化。
- 研究加速器 Tile 尺寸以及 I/O 带宽、参数缓存等配置参数对推理延迟的影响。
- 开发并验证一种可学习的机器学习模型,以准确估计边缘 TPU 的关键性能指标(延迟、能耗),作为周期精确仿真器的快速替代方案。
提出的方法
- 该研究采用基于模板的参数化边缘 TPU 微架构,包含一个二维处理单元(PE)阵列,每个 PE 拥有多个支持 SIMD MAC 单元的计算通道。
- 每个 PE 配备共享的 PE 内存用于存储激活值和部分结果,以及多银行核心内存用于存储模型参数,以支持高吞吐量计算。
- 软件栈使用 TensorFlow Lite 模型,工作负载通过包含编译器、运行时和硬件仿真的完整软件栈进行编译和执行。
- 训练图神经网络(GNN)以学习神经网络图的潜在表征,并预测推理延迟和能耗等性能指标。
- GNN 模型在包含 254,160 个 NASBench 模型的数据集上进行训练,评估使用 84,680 个保留的测试样本,使用学习率 0.001 和批量大小 16 等超参数。
- 通过与周期精确仿真器的真实值对比,使用平均绝对误差、Spearman 等级相关性以及皮尔逊相关性来评估性能估计的准确性。

实验结果
研究问题
- RQ1边缘 TPU 性能如何随不同架构、大小和操作类型的卷积神经网络而变化?
- RQ2对于具有不同可训练参数数量的模型,加速器 Tile 尺寸和 I/O 带宽对推理延迟有何影响?
- RQ3与周期精确仿真相比,可学习模型在估计边缘 TPU 性能指标方面的有效性如何?
- RQ4在哪些场景下参数缓存能提升性能,何时会出现收益递减?
- RQ5具有高等级相关性的可学习模型能否在硬件/软件协同设计和设计空间探索中替代昂贵的仿真器?
主要发现
- 该可学习模型在三种边缘 TPU 配置下,对推理延迟的估计平均准确率达 96.8% 至 97.9%,平均绝对误差约为 3%。
- 该模型与真实延迟的 Spearman 等级相关性为 0.99977 至 0.99981,皮尔逊相关性为 0.99959 至 0.99975,表明等级排序保真度近乎完美。
- 对于参数量大(如大量 3×3 卷积)的大型模型,由于 I/O 带宽更高,配置 V2 的性能优于其他配置,而参数缓存带来的收益递减。
- 对于参数量较少的小型模型,配置 V1 更受益于参数缓存,从而实现更低的延迟。
- 推理延迟与可训练参数数量的相关性最强,表明 I/O 带宽是主要性能瓶颈,而非 PEs 或计算核心的数量。
- 减小加速器 Tile 尺寸可在保持相似性能的同时实现,表明更小、更高效的 Tile 对许多工作负载是可行的。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。