Skip to main content
QUICK REVIEW

[论文解读] EEG based Continuous Speech Recognition using Transformers

Gautam Krishna, Co Tran|arXiv (Cornell University)|Dec 31, 2019
EEG and Brain-Computer Interfaces参考文献 16被引用 4
一句话总结

本论文研究基于Transformer架构的端到端EEG连续语音识别,发现在小词汇量(如5个唯一句子)下,其训练速度更快且性能优于基于RNN的模型;然而,随着词汇量增大(如30个句子),RNN-CTC模型表现优于Transformer,且Transformer的词错误率(WER)显著上升。

ABSTRACT

In this paper we investigate continuous speech recognition using electroencephalography (EEG) features using recently introduced end-to-end transformer based automatic speech recognition (ASR) model. Our results demonstrate that transformer based model demonstrate faster training compared to recurrent neural network (RNN) based sequence-to-sequence EEG models and better performance during inference time for smaller test set vocabulary but as we increase the vocabulary size, the performance of the RNN based models were better than transformer based model on a limited English vocabulary.

研究动机与目标

  • 探索基于Transformer的模型在端到端EEG转文本连续语音识别中的可行性。
  • 从训练速度、推理性能和词汇量增加下的鲁棒性等方面,比较基于Transformer的模型与成熟的RNN-CTC模型。
  • 评估注意力机制在EEG序列建模中的可解释性,特别是EEG输入与预测文本之间的对齐情况。
  • 评估数据量和模型容量对性能的影响,尤其考虑到EEG信号的复杂性和噪声特性。

提出的方法

  • 本研究采用标准的Transformer编码器-解码器架构,编码器和解码器均包含8层堆叠,每层包含多头自注意力子层和前馈子层,配备残差连接和层归一化。
  • 使用正弦和余弦函数进行位置编码,以保持序列顺序,其中 d_model = 256,d_ff = 1024,d_k = d_v = 8,h = 32 个注意力头。
  • 编码器和解码器之间共享嵌入权重,通过全连接层配合Softmax激活函数,每个时间步预测一个词。
  • 使用Adam优化器进行120个周期的训练,批量大小为100,损失函数为交叉熵损失。
  • 推理阶段采用束搜索(beam search),结合4-gram语言模型(浅层融合),生成在序列结束标记处停止。
  • 模型在先前研究中的两个EEG数据集(A和B)上进行评估,以词错误率(WER)作为主要指标,覆盖不同大小的测试集。

实验结果

研究问题

  • RQ1在小词汇量测试集下,Transformer架构是否在EEG-based连续语音识别中优于RNN-CTC模型?
  • RQ2随着测试词汇量增大,模型性能(尤其是WER)如何变化?
  • RQ3考虑到EEG信号的复杂性和噪声特性,Transformer中的注意力机制是否具有可解释性?
  • RQ4与RNN-CTC模型相比,Transformer模型在EEG数据上是否具有更快的训练和推理时间?
  • RQ5数据量扩大是否能缓解Transformer在更大词汇量下的性能下降?

主要发现

  • 在仅包含5个唯一句子的测试集上,Transformer模型在数据集A上的WER为67.7%,在数据集B上为62.5%,优于RNN-CTC模型。
  • 当词汇量增至30个唯一句子时,Transformer的WER在数据集A上上升至93.95%,在数据集B上上升至96.8%,表明性能出现显著下降。
  • 来自[12]的RNN-CTC模型在所有测试的词汇量下均持续优于Transformer模型,WER更低。
  • Transformer模型每样本训练速度比RNN-CTC模型快2.4倍(数据集A上分别为0.017分钟和0.041分钟/样本),但推理时间更长。
  • 尽管训练更快,Transformer模型的推理时间仍长于RNN-CTC模型(每样本0.016分钟 vs. 0.0015分钟),主要由于参数量更高及权重加载时间更长。
  • EEG输入的注意力可视化结果难以解释,注意力权重与有意义的语言或神经特征之间无明显对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。