Skip to main content
QUICK REVIEW

[论文解读] Improving EEG based Continuous Speech Recognition

Gautam Krishna, Co Tran|arXiv (Cornell University)|Nov 24, 2019
Speech Recognition and Synthesis参考文献 15被引用 10
一句话总结

该论文通过使用预训练模型初始化GRU编码器权重(该模型可从EEG预测语音和发音特征)、在束搜索中集成外部语言模型,并展示低误差的发音特征预测,从而提升了基于EEG的连续语音识别性能。这些技术显著将词汇量更大的数据集上的词错误率(WER)从84.9%降低至74.45%,增强了辅助技术应用的鲁棒性。

ABSTRACT

In this paper we introduce various techniques to improve the performance of electroencephalography (EEG) features based continuous speech recognition (CSR) systems. A connectionist temporal classification (CTC) based automatic speech recognition (ASR) system was implemented for performing recognition. We introduce techniques to initialize the weights of the recurrent layers in the encoder of the CTC model with more meaningful weights rather than with random weights and we make use of an external language model to improve the beam search during decoding time. We finally study the problem of predicting articulatory features from EEG features in this paper.

研究动机与目标

  • 解决基于EEG的连续语音识别(CSR)系统性能有限的问题,特别是针对言语功能障碍者。
  • 克服基于CTC的ASR模型中RNN编码器随机权重初始化的局限性。
  • 通过浅层融合将外部4-gram语言模型与CTC束搜索结合,提升解码鲁棒性。
  • 探索从EEG预测发音特征在增强编码器表征学习方面的潜力。
  • 在比以往EEG-ASR研究更大的英语词汇量上,展示改进的CSR性能。

提出的方法

  • 使用均方误差(MSE)损失,预训练一个两层GRU模型,从30维EEG输入中预测拼接后的MFCC(13维)和发音特征(6维)。
  • 使用预训练回归模型学习到的权重初始化CTC编码器中的前两层GRU,而非随机初始化。
  • 使用具有32个滤波器、卷积核大小为2和一个残差块的时序卷积网络(TCN),将RNN表征映射为文本标记。
  • 在120个周期内使用Adam优化器应用CTC损失,批量大小为32,并使用dropout(0.1)进行正则化。
  • 采用基于字符的CTC解码器,结合外部4-gram语言模型通过浅层融合增强束搜索解码。
  • 使用预测与真实发音特征之间的RMSE和归一化RMSE评估发音特征预测性能。

实验结果

研究问题

  • RQ1是否可以通过使用预训练回归模型的权重初始化CTC-based EEG-ASR模型中的GRU编码器,来提升识别准确率?
  • RQ2在束搜索解码过程中集成外部语言模型,能在多大程度上降低EEG-based CSR的词错误率?
  • RQ3能否使用基于TCN的架构从EEG信号中准确预测发音特征?
  • RQ4与仅使用一个脑区相比,结合额叶和颞叶传感器的EEG特征是否能提升CSR性能?
  • RQ5在更大的词汇量上,是否可以通过添加来自MFCC+发音特征到文本模型的冻结预训练GRU层对,进一步降低WER?

主要发现

  • 使用预训练GRU权重初始化编码器,使数据集B(180个测试句,1112个唯一词)上的WER从84.9%降低至74.45%。
  • 在束搜索解码过程中加入外部4-gram语言模型,显著提升了解码性能,使WER从84.9%降低至74.45%。
  • 在数据集A上,发音特征预测的平均RMSE为0.632,归一化RMSE为0.115;在数据集B上,分别为1.30和0.238。
  • 结合额叶和颞叶的EEG特征(85维)得到的WER为85.32%,略优于仅使用额叶(85.45%)或颞叶(86.52%)传感器的情况。
  • 在数据集A上,向编码器添加一对冻结的预训练GRU层(128, 64个单元),使15个唯一测试句的WER降低至78.39%,表明在更大词汇量上仍存在边际提升。
  • 所提方法在更大词汇量(180句话,1112个词)上实现了74.45%的WER,优于以往EEG-ASR系统在类似基准上的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。