[论文解读] Low-Power Audio Keyword Spotting using Tsetlin Machines
本文提出了一种基于Tsetlin Machines(TMs)的低功耗关键词检测(KWS)系统,TMs是一种基于逻辑的机器学习模型,通过用布尔逻辑替代神经网络中的计算密集型运算,实现更快的收敛速度、更少的参数量以及更低的能耗。基于TM的KWS流水线在显著降低复杂度和硬件占用面积的同时,实现了与深度神经网络(DNNs)相当的准确率,展现出在边缘AI设备中芯片级部署的强大潜力。
The emergence of Artificial Intelligence (AI) driven Keyword Spotting (KWS) technologies has revolutionized human to machine interaction. Yet, the challenge of end-to-end energy efficiency, memory footprint and system complexity of current Neural Network (NN) powered AI-KWS pipelines has remained ever present. This paper evaluates KWS utilizing a learning automata powered machine learning algorithm called the Tsetlin Machine (TM). Through significant reduction in parameter requirements and choosing logic over arithmetic based processing, the TM offers new opportunities for low-power KWS while maintaining high learning efficacy. In this paper we explore a TM based keyword spotting (KWS) pipeline to demonstrate low complexity with faster rate of convergence compared to NNs. Further, we investigate the scalability with increasing keywords and explore the potential for enabling low-power on-chip KWS.
研究动机与目标
- 解决边缘设备中基于神经网络的关键词检测(KWS)存在的高能耗和高计算复杂度问题。
- 探索使用Tsetlin Machines(TMs)作为深度神经网络(DNNs)在KWS流水线中的低功耗替代方案的可行性。
- 评估在不同超参数和关键词数量下,基于TM的KWS系统的可扩展性和能效表现。
- 展示通过使用基于逻辑的处理而非算术计算,实现KWS流水线硬件加速的潜力。
- 通过TM特有的优化手段,最小化模型大小和系统延迟,实现真正的实时、芯片级关键词检测。
提出的方法
- KWS流水线使用梅尔频率倒谱系数(MFCCs)作为输入特征,通过分位数分箱法将这些特征转换为布尔形式。
- Tsetlin Machine利用基于短语的逻辑架构处理这些布尔特征,以反馈驱动的学习自动机替代基于梯度的反向传播。
- 通过调节短语数量、短语大小和阈值等超参数,实现准确率、能效和收敛速度之间的平衡。
- 在Raspberry Pi上实现系统,以评估在低功耗嵌入式环境中的实时性能和能耗表现。
- 使用TensorFlow语音命令数据集,将该流水线与标准DNN和量化CNN模型进行对比。
- 信号处理优化包括调整窗函数,以在最小性能损失下降低MFCC的维度。
实验结果
研究问题
- RQ1基于Tsetlin Machine的KWS流水线是否能在显著减少参数量的同时,实现与深度神经网络相当的准确率?
- RQ2短语数量和反馈超参数如何影响基于TM的KWS系统的收敛速度和能效?
- RQ3在不降低分类性能的前提下,MFCC离散化能否被简化至每个特征仅保留一个布尔值?
- RQ4随着关键词数量的增加,基于TM的KWS流水线在准确率和资源使用方面如何扩展?
- RQ5基于TM的系统是否能够有效部署在低功耗微控制器上,以实现芯片级、实时的关键词检测?
主要发现
- 基于Tsetlin Machine的KWS流水线在使用数量级更少的参数和短语的同时,实现了与DNNs和量化CNNs相当的准确率。
- 由于去除了梯度下降和计算密集型运算,该系统在训练过程中表现出更快的收敛速度。
- 将MFCC特征简化为每个系数仅保留一个布尔值,对性能影响极小,从而显著降低了模型大小和计算负载。
- 减少短语数量并调节阈值超参数,可在不牺牲准确率的前提下,提升能效和降低延迟。
- 由于其基于逻辑的计算方式,该系统在硬件加速方面展现出巨大潜力,其能效显著优于浮点数算术运算。
- 该系统已在Raspberry Pi上成功评估,证实其在边缘AI应用中实现低功耗、芯片级部署的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。