[论文解读] FATE: Fast and Accurate Timing Error Prediction Framework for Low Power DNN Accelerator Design
FATE 是一种针对低功耗 DNN 加速器的快速且精确的定时错误预测框架,结合了基于 DNN 的延迟模型(DelayNet)和 MAC 操作的统计采样。它在定时仿真中实现了 8×–58× 的加速,分类准确率误差低于 2%,从而实现了高效的架构探索——例如,表明符号-大小表示法可降低定时错误,并在相同准确率下实现比 2 的补码高 18% 的能效节省。
Deep neural networks (DNN) are increasingly being accelerated on application-specific hardware such as the Google TPU designed especially for deep learning. Timing speculation is a promising approach to further increase the energy efficiency of DNN accelerators. Architectural exploration for timing speculation requires detailed gate-level timing simulations that can be time-consuming for large DNNs that execute millions of multiply-and-accumulate (MAC) operations. In this paper we propose FATE, a new methodology for fast and accurate timing simulations of DNN accelerators like the Google TPU. FATE proposes two novel ideas: (i) DelayNet, a DNN based timing model for MAC units; and (ii) a statistical sampling methodology that reduces the number of MAC operations for which timing simulations are performed. We show that FATE results in between 8 times-58 times speed-up in timing simulations, while introducing less than 2% error in classification accuracy estimates. We demonstrate the use of FATE by comparing to conventional DNN accelerator that uses 2's complement (2C) arithmetic with an alternative implementation that uses signed magnitude representations (SMR). We show that that the SMR implementation provides 18% more energy savings for the same classification accuracy than 2C, a result that might be of independent interest.
研究动机与目标
- 为解决大规模 DNN 加速器(如 Google TPU)的门级定时仿真运行时间过长的问题,例如针对最先进的 AlexNet 模型,其仿真时间可达数百小时。
- 实现 DNN 加速器中定时推测技术的高效架构探索,尤其针对低功耗设计。
- 比较不同数据表示方式(特别是 2 的补码(2C)与符号-大小表示法(SMR))对定时错误率和能效的影响。
- 开发一种可扩展、精确且快速的仿真框架,以减少全门级仿真带来的计算负担,同时不牺牲预测保真度。
提出的方法
- FATE 引入 DelayNet,一种深度神经网络,用于基于其输入值预测单个 MAC 单元的延迟,从而替代昂贵的门级仿真进行延迟估计。
- 它采用统计采样方法,仅仿真部分 MAC 单元(例如,流水线阵列中的选定列),然后以相同观测到的错误率对剩余单元进行概率性定时错误注入。
- 该框架将功能仿真与 DelayNet 预测的延迟相结合,以估计定时错误对 DNN 推理准确率的影响。
- FATE 支持两种变体:FATE-DNN(使用 DelayNet 进行延迟预测)和 FATE-Samp(使用采样以减少仿真负载),两者均可实现快速且精确的错误率估计。
- 该方法利用了流水线阵列架构的规律性和一致性,其中 MAC 单元完全相同,并在相似的输入分布下运行。
- 它通过与全门级仿真对比验证了预测结果,展示了在分类准确率和定时错误率估计方面具有极低误差的高精度。
实验结果
研究问题
- RQ1如何在不牺牲准确率的前提下,加速大规模 DNN 加速器的定时错误仿真?
- RQ2数据表示方式(特别是 2 的补码与符号-大小表示法)对 DNN 加速器中定时错误率和能效的影响是什么?
- RQ3学习得到的延迟模型(DelayNet)能否在 DNN 工作负载的多样化输入模式下准确预测 MAC 单元的延迟?
- RQ4对 MAC 操作进行统计采样在多大程度上可以减少仿真时间,同时保持定时错误估计的保真度?
- RQ5在基于流水线阵列的 DNN 加速器中,使用不同算术表示进行定时推测时,其能效-准确率权衡关系如何?
主要发现
- FATE 将 AlexNet 的仿真时间从 384 小时(全门级仿真)缩短至 7 至 48 小时,根据所用变体不同,实现了 8× 至 58.57× 的加速。
- FATE 的分类准确率估计与全仿真结果的差异低于 2%,定时错误率估计的平均误差为 4.3%–6.17%。
- SMR 基于的 MAC 单元在小权重值下表现出显著更低的平均和最大延迟,这是由于最低有效位的翻转活动减少所致。
- 在 AlexNet 上,SMR 基于的加速器在相同能效节省下,分类准确率最高可比 2C 提高 14.45%,或在相同准确率下实现 18% 的更高能效节省。
- 结果表明,SMR 比 2C 对定时错误更具鲁棒性,因此是低功耗、基于定时推测的 DNN 加速器的更优选择。
- FATE 通过大幅减少仿真时间并保持高预测准确率,使此前无法实现的架构探索(如在 ImageNet 上的完整验证)成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。