[论文解读] Speech Recognition with no speech or with noisy speech
本文提出了一种基于深度学习的自动语音识别(ASR)系统,利用脑电图(EEG)特征实现高精度的词汇和元音识别,即使在无语音输入或噪声环境下也能保持高性能。通过结合门控循环单元(GRUs)、知识蒸馏与EEG特征融合,该模型在噪声环境下的词汇识别测试准确率达到99.38%,证明了EEG能够有效补偿因声学性能下降带来的影响。
The performance of automatic speech recognition systems(ASR) degrades in the presence of noisy speech. This paper demonstrates that using electroencephalography (EEG) can help automatic speech recognition systems overcome performance loss in the presence of noise. The paper also shows that distillation training of automatic speech recognition systems using EEG features will increase their performance. Finally, we demonstrate the ability to recognize words from EEG with no speech signal on a limited English vocabulary with high accuracy.
研究动机与目标
- 开发一种在传统声学模型失效的噪声语音环境中仍能保持高准确率的ASR系统。
- 探究仅依靠EEG信号是否能够在无任何语音输入的情况下实现准确的词汇与元音识别。
- 评估通过知识蒸馏提升ASR性能时,EEG特征的有效性。
- 识别在声学条件退化情况下的鲁棒语音识别任务中,最优的EEG特征与模型架构。
提出的方法
- 使用三种输入模态(声学特征(MFCCs)、EEG特征及其拼接)训练了一个基于GRU的深度学习模型。
- 从31个头皮电极提取EEG特征,并使用多项式核(度数为3)的核主成分分析(KPCA)将维度从155维降低至117维。
- 从39维的KPCA输出中计算差分与差分-差分特征,以增强时间动态特性,最终得到117维的EEG特征。
- 采用温度缩放为2、lambda值为0.2的知识蒸馏方法,将教师模型的知识迁移至学生模型。
- 学生模型通过模仿教师模型的软标签进行训练,从而提升泛化能力与鲁棒性,尤其在噪声条件下表现更优。
- 在仅使用EEG的识别任务中,采用4通道子集(T7、T8、Fc5、P7),在无噪声条件下对元音识别达到93%的准确率,表明对通道数量的需求极低。
实验结果
研究问题
- RQ1仅依靠EEG信号是否能够在无任何声学输入的情况下实现准确的词汇级语音识别?
- RQ2在背景噪声下,EEG特征能在多大程度上补偿ASR系统性能的下降?
- RQ3使用EEG增强模型进行知识蒸馏是否能提升ASR系统的准确率与鲁棒性?
- RQ4哪些EEG特征与特征降维技术能为语音识别任务提供最有效的表征?
主要发现
- 所提出的仅使用EEG的ASR模型在存在背景噪声的情况下,对四个词汇('yes'、'no'、'left'、'right')的测试准确率达到99.38%。
- 在噪声条件下,仅使用EEG的模型优于仅使用MFCC的模型,词汇识别准确率达到98.39%(对比MFCC-only模型的94.53%),元音识别准确率达到92.00%(对比MFCC-only模型的73.33%)。
- 采用温度为2、lambda为0.2的知识蒸馏方法,使学生模型在无噪声条件下的词汇识别测试准确率达到98.61%,在有噪声条件下的准确率达到97.62%。
- 通过使用度数为3的多项式核的KPCA方法,将EEG特征从155维降低至117维,该方法在所有数据集上均取得最佳性能。
- T7、T8、Fc5与P7导联对识别准确率贡献最大,表明其在捕捉与语音相关的神经活动模式方面具有关键作用。
- 模型未表现出显著过拟合现象,所有配置下训练、验证与测试准确率均保持高度一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。