[论文解读] Hardware Aware Training for Efficient Keyword Spotting on General Purpose and Specialized Hardware
本文提出针对基于勒让德记忆单元(LMU)的关键词检测(KWS)模型的硬件感知训练(HAT),在极小模型尺寸和超低功耗下实现了最先进水平的准确率(95.9%)。通过协同优化LMU架构与硬件部署,该方法在定制加速器硬件上实现了仅8.79 μW的实时、设备端推理,功耗效率较通用微控制器高出24倍,较专用ASIC高出16倍。
Keyword spotting (KWS) provides a critical user interface for many mobile and edge applications, including phones, wearables, and cars. As KWS systems are typically 'always on', maximizing both accuracy and power efficiency are central to their utility. In this work we use hardware aware training (HAT) to build new KWS neural networks based on the Legendre Memory Unit (LMU) that achieve state-of-the-art (SotA) accuracy and low parameter counts. This allows the neural network to run efficiently on standard hardware (212$μ$W). We also characterize the power requirements of custom designed accelerator hardware that achieves SotA power efficiency of 8.79$μ$W, beating general purpose low power hardware (a microcontroller) by 24x and special purpose ASICs by 16x.
研究动机与目标
- 开发一种适用于实时、始终开启边缘设备的高精度、低功耗关键词检测系统。
- 解决现有KWS模型在实际部署约束(如流式推理、量化和功耗效率)方面未充分优化的局限性。
- 证明硬件感知训练(HAT)可实现跨多种硬件平台(包括通用微控制器和定制加速器)的卓越性能。
- 在准确率、模型尺寸和功耗效率方面实现同步的最先进成果,尤其针对多关键词检测任务。
- 表明参数高效的LMU基模型可在功耗效率上超越专用ASIC,同时保持高准确率。
提出的方法
- 作者采用硬件感知训练(HAT)协同优化神经网络架构与硬件部署,在训练过程中显式建模硬件约束。
- 采用勒让德记忆单元(LMU),一种使用勒让德基函数实现可证明最优记忆压缩的循环架构,减少参数数量并提升长期记忆保持能力。
- 对LMU进行修改,移除内部循环连接,并引入多个线性记忆层,其输出在非线性变换前进行拼接。
- 将模型量化至8位权重和激活值,以实现低功耗硬件上的高效部署。
- 设计定制加速器硬件,集成动态电压与频率调节(DVFS)和优化的连接逻辑,以最小化实时运行时的功耗。
- 通过HAT将硬件与模型协同设计,实现对不同频率设置下功耗、延迟和吞吐量的直接优化。
实验结果
研究问题
- RQ1硬件感知训练(HAT)是否可用于协同优化神经网络架构与硬件部署,以实现实时、低功耗的关键词检测?
- RQ2勒让德记忆单元(LMU)架构是否在KWS任务中相比标准RNN和CNN实现更高的准确率和更低的参数数量?
- RQ3定制设计的加速器是否可显著优于通用微控制器和现有专用ASIC的功耗效率?
- RQ4参数高效的LMU模型在多大程度上可消除对专用硬件的依赖,同时保持或超越性能?
- RQ5HAT与LMU架构的结合在不同硬件平台上对功耗效率、准确率和模型尺寸有何影响?
主要发现
- 基于LMU的KWS模型在SpeechCommands数据集上达到95.9%的准确率,优于以往最先进模型的准确率与效率。
- 该模型参数量仅为Syntiant NDP10x ASIC的1/12,但准确率更高(95.9% vs. 94.0%),且功耗低16–19倍。
- 在标准ARM M4F微控制器上,模型功耗为212 μW,较最佳报告的通用硬件效率提升24倍。
- 定制加速器在92 kHz时钟频率下实现创纪录的8.79 μW功耗,帧处理吞吐量为13.38 ms,40 ms更新延迟为39.59 ms。
- 经HAT优化的LMU模型在理想化ARM M4F上运行功耗为119 μW,较最佳报告的通用硬件功耗效率提升14倍。
- 结果表明,HAT可实现跨硬件平台的功耗效率直接优化,使高准确率、低功耗KWS在通用与专用硬件上均成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。