Skip to main content
QUICK REVIEW

[论文解读] EEG2TEXT: Open Vocabulary EEG-to-Text Decoding with EEG Pre-Training and Multi-View Transformer

Hanwen Liu, Daniel Hajialigol|arXiv (Cornell University)|May 3, 2024
EEG and Brain-Computer Interfaces被引用 4
一句话总结

EEG2Text 提出了一种新颖的开放词汇 EEG 到文本解码模型,通过利用 EEG 预训练和多视角变换器,提升了语义表征能力和解码准确率。通过在掩码原始 EEG 信号上进行预训练,并通过多视角变换器建模大脑的各个空间区域,该方法实现了最先进性能,在绝对 BLEU 和 ROUGE 分数上相比之前的方法最高提升 5%。

ABSTRACT

Deciphering the intricacies of the human brain has captivated curiosity for centuries. Recent strides in Brain-Computer Interface (BCI) technology, particularly using motor imagery, have restored motor functions such as reaching, grasping, and walking in paralyzed individuals. However, unraveling natural language from brain signals remains a formidable challenge. Electroencephalography (EEG) is a non-invasive technique used to record electrical activity in the brain by placing electrodes on the scalp. Previous studies of EEG-to-text decoding have achieved high accuracy on small closed vocabularies, but still fall short of high accuracy when dealing with large open vocabularies. We propose a novel method, EEG2TEXT, to improve the accuracy of open vocabulary EEG-to-text decoding. Specifically, EEG2TEXT leverages EEG pre-training to enhance the learning of semantics from EEG signals and proposes a multi-view transformer to model the EEG signal processing by different spatial regions of the brain. Experiments show that EEG2TEXT has superior performance, outperforming the state-of-the-art baseline methods by a large margin of up to 5% in absolute BLEU and ROUGE scores. EEG2TEXT shows great potential for a high-performance open-vocabulary brain-to-text system to facilitate communication.

研究动机与目标

  • 解决准确的开放词汇 EEG 到文本解码挑战,该挑战仍受限于在大规模、多样化词汇上的低性能表现。
  • 克服先前方法依赖眼动追踪校准来提取词级 EEG 特征所带来的误差,并降低泛化能力的问题。
  • 通过在掩码原始 EEG 输入上进行端到端预训练,提升原始 EEG 信号的语义表征能力。
  • 通过采用多视角变换器架构,建模大脑信号在不同空间区域的处理过程,从而提升解码性能。
  • 开发一种可泛化的非侵入式脑到文本系统,仅使用句子级别的 EEG 信号即可实现自然语言通信。

提出的方法

  • 采用基础卷积变换器模型处理长时序、噪声较大的原始 EEG 信号,以提取局部和全局的时间-空间特征。
  • 实施一种预训练目标,即对原始 EEG 信号的随机片段进行掩码,并训练模型重建原始信号,从而增强语义学习能力。
  • 引入一种多视角变换器架构,其中每个视角对应大脑的一个独立空间区域,实现区域特定的信号处理。
  • 在多视角设置中,将预训练的变换器作为每个视角的主干网络,通过共享和专用特征提升表征学习能力。
  • 利用预训练的 BART 模型进行自回归文本生成,其输入为多视角 EEG 表征。
  • 采用端到端的序列到序列目标联合训练整个模型,优化文本生成的 BLEU 和 ROUGE 分数。

实验结果

研究问题

  • RQ1在原始信号上进行 EEG 预训练是否能提升开放词汇 EEG 到文本解码的语义表征学习能力?
  • RQ2与单一统一表征相比,通过多个大脑空间视角建模 EEG 信号在多大程度上能提升解码性能?
  • RQ3所提出的 EEG2Text 模型在开放词汇 EEG 到文本翻译任务中,相比现有最先进方法的性能提升程度如何?
  • RQ4非侵入式 EEG 系统是否能在不依赖眼动追踪进行特征提取的情况下实现高精度解码?
  • RQ5预训练与多视角注意力的结合是否能带来更好的泛化能力和解码鲁棒性,以应对多样化的现实世界文本输入?

主要发现

  • EEG2Text 在开放词汇 EEG 到文本解码任务中实现了最先进性能,相比最佳基线方法,BLEU 和 ROUGE 分数最高提升 5%(绝对值)。
  • 所提出的 EEG 预训练策略显著提升了模型从原始 EEG 信号中学习有意义语义表征的能力,尤其在低资源和开放词汇设置下表现突出。
  • 多视角变换器架构通过捕捉区域特定的神经动力学,提升了性能,实现了更准确且上下文相关的文本生成。
  • 该模型表现出强大的泛化能力,仅需句子级别的 EEG 输入,无需依赖眼动追踪校准,从而更适用于内在言语和自然阅读等场景。
  • 消融实验证实,EEG 预训练和多视角注意力均为关键组件,两者均对整体性能提升有显著贡献。
  • 该模型在多种语言模式下保持高性能,包括同音词和语义相近词汇,表明其在具有挑战性的解码场景中具备鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。