[论文解读] An Ultra-low Power RNN Classifier for Always-On Voice Wake-Up Detection Robust to Real-World Scenarios
本文提出了一种超低功耗的基于RNN的分类器,用于持续运行的语音唤醒检测,通过在精心筛选的数据集和损失函数上进行训练,实现了对真实世界噪声的鲁棒性优化。在功耗低于45 nW、65nm CMOS工艺下,仅使用0.52 kB内存,其功耗占空比低于1%时,无触发率低于3%,显著优于传统VAD方法,能够精确标记语音起始时刻。
We present in this paper an ultra-low power (ULP) Recurrent Neural Network (RNN) based classifier for an always-on voice Wake-Up Sensor (WUS) with performances suitable for real-world applications. The purpose of our sensor is to bring down by at least a factor 100 the power consumption in background noise of always-on speech processing algorithms such as Automatic Speech Recognition, Keyword Spotting, Speaker Verification, etc. Unlike the other published approaches, we designed our wake-up sensor to be robust to unseen real-world noises for realistic levels of speech and noise by carefully designing the dataset and the loss function. We also specifically trained it to mark only the speech start rather than adopting a traditional Voice Activity Detection (VAD) approach. We achieve less than 3% No Trigger Rate (NTR) for a duty cycle less than 1% in challenging background noises pooled using a model of an analogue front-end. We demonstrate the superiority of RNNs on this task compared to the other tested approaches, with an estimated power consumption of 45 nW for the RNN itself in 65nm CMOS and a minimal memory footprint of 0.52 kB.
研究动机与目标
- 将持续运行语音处理系统的背景功耗降低至少100倍。
- 开发一种在真实语音和噪声水平下对未见真实世界噪声条件具有鲁棒性的唤醒传感器。
- 训练模型仅检测语音起始时刻,而非持续语音活动,以提高效率。
- 最小化硬件资源使用,目标为超低功耗(45 nW)和最小内存(0.52 kB),采用65nm CMOS工艺。
- 在具有挑战性的声学条件下,性能优于现有方法,表现出更强的鲁棒性和更高的效率。
提出的方法
- 作者设计了一个包含真实噪声水平和多样化真实世界条件的定制数据集,用于训练RNN分类器。
- 开发了一种专用损失函数,强调对语音起始时刻的精确检测,避免传统VAD风格的持续激活。
- RNN模型通过端到端方式训练,以判断给定音频段是否包含语音起始。
- 通过模拟模拟前端模型对系统进行评估,以模拟真实世界信号退化和噪声。
- 最终模型针对超低功耗CMOS硬件进行了优化,目标为65nm工艺技术。
- 应用了模型量化和硬件感知训练技术,以实现45 nW的功耗和0.52 kB的内存占用。
实验结果
研究问题
- RQ1基于RNN的分类器是否能在多样化、未见的真实世界噪声环境中实现鲁棒的唤醒检测?
- RQ2与持续语音活动检测相比,专注于语音起始检测的训练是否能提升功耗效率和准确性?
- RQ3在65nm CMOS实现中,能否在保持高性能的同时实现超低功耗(45 nW)和最小内存(0.52 kB)?
- RQ4与传统VAD及其他基线方法相比,该方法在无触发率和占空比方面表现如何?
- RQ5数据集和损失函数的设计在多大程度上提升了对真实世界噪声的鲁棒性?
主要发现
- 在具有挑战性的背景噪声条件下,RNN分类器的无触发率低于3%,占空比低于1%。
- 该模型在65nm CMOS工艺下仅消耗45 nW的功耗,显著降低了背景功耗。
- 系统仅需0.52 kB的内存,适用于资源受限的嵌入式部署。
- RNN在该任务中优于其他测试方法,展现出更优的鲁棒性和效率。
- 定制数据集和损失函数设计显著增强了对未见真实世界噪声的鲁棒性。
- 系统能够以高精度检测语音起始,避免在非语音段产生误触发。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。