[论文解读] A Fast Network Exploration Strategy to Profile Low Energy Consumption for Keyword Spotting
该论文提出了一种基于回归的网络探索策略,可快速识别适用于FPGA上关键词检测(KWS)的低功耗、量化和缩放的深度神经网络(DNN)配置。通过在滤波器缩放(s)和量化(q)参数上对能耗和精度进行多项式回归建模,该方法实现了快速的硬件感知设计空间探索,在Xilinx AC701平台上实现的能耗比先前基于FPGA的KWS加速器降低2.1倍,能效提升4倍。
Keyword Spotting nowadays is an integral part of speech-oriented user interaction targeted for smart devices. To this extent, neural networks are extensively used for their flexibility and high accuracy. However, coming up with a suitable configuration for both accuracy requirements and hardware deployment is a challenge. We propose a regression-based network exploration technique that considers the scaling of the network filters ($s$) and quantization ($q$) of the network layers, leading to a friendly and energy-efficient configuration for FPGA hardware implementation. We experiment with different combinations of $\mathcal{NN}\scriptstyle\langle q,\,s angle \displaystyle$ on the FPGA to profile the energy consumption of the deployed network so that the user can choose the most energy-efficient network configuration promptly. Our accelerator design is deployed on the Xilinx AC 701 platform and has at least 2.1$ imes$ and 4$ imes$ improvements on energy and energy efficiency results, respectively, compared to recent hardware implementations for keyword spotting.
研究动机与目标
- 为在资源受限的FPGA上实现低功耗、高精度的关键词检测(KWS),解决选择最优DNN超参数(滤波器缩放s和量化q)的挑战。
- 通过用回归建模替代穷举搜索,降低DNN配置探索的时间和计算成本,以实现硬件部署的高效配置探索。
- 实现快速识别满足实时KWS精度要求的低功耗网络配置,适用于低成本FPGA。
- 设计一种可扩展的、参数化的加速器架构,支持多种处理单元和精度级别,以实现FPGA上的高效部署。
提出的方法
- 开发了一种基于回归的网络探索框架,将能耗和精度建模为量化(q)和滤波器缩放(s)参数的函数。
- 使用一组小型DNN(12种配置)的实验数据训练两个多项式回归模型,以预测未见的(q,s)组合的精度和能耗。
- 采用系统化、实验与分析相结合的方法,对Xilinx AC701 FPGA上的DNN能耗进行性能分析,重点聚焦于基于MFCC的KWS工作负载。
- 设计了一种参数化、可扩展的硬件加速器,支持多种(q,s)配置,通过输出通道分块技术最大化处理单元(PE)利用率和性能。
- 该框架可在无需对每个候选配置进行完整重训练或硬件综合的情况下,实现最优配置的快速选择。
- 通过将回归预测结果与新(q,s)配置的实际测量值对比,验证了该方法,结果显示预测精度高。
实验结果
研究问题
- RQ1在FPGA上的DNN-KWS中,滤波器缩放(s)和量化(q)的变化对能耗和精度有何影响?
- RQ2在无需完整硬件综合的情况下,多项式回归模型能否准确预测不同(q,s)配置下DNN的能耗和精度?
- RQ3与穷举搜索或神经架构搜索(NAS)相比,该方法如何降低DNN配置探索的时间和成本?
- RQ4在低成本FPGA上,采用所提出的硬件感知探索策略,KWS可实现的能效与精度权衡如何?
- RQ5该回归模型能否推广至指导不同FPGA平台和精度级别的加速器设计?
主要发现
- 回归模型表现出高预测精度,预测的能耗和精度值与未见(q,s)配置的实际测量值高度吻合。
- 所提出的加速器在相同XC7A200T FPGA平台上,相比Dinelli等人(2019)的近期工作,能耗降低2.1倍,能效提升4倍。
- 在100 MHz时钟频率下,该设计比Zhang等人(2017)基于微控制器的实现快8.5倍,同时功耗更低。
- 模型大小仅为340 KB,适合部署于低成本微控制器或边缘设备。
- 该方法将完整设计空间分析所需的DNN训练次数减少至仅12次,实现了快速探索。
- 在4位量化和4.5倍滤波器缩放下,该设计实现了90.1%的准确率,能耗为0.58 mJ,优于以往基于FPGA的KWS系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。