Skip to main content
QUICK REVIEW

[论文解读] NeuroLM: A Universal Multi-task Foundation Model for Bridging the Gap between Language and EEG Signals

Wei-Bang Jiang, Yansen Wang|arXiv (Cornell University)|Aug 27, 2024
EEG and Brain-Computer Interfaces被引用 4
一句话总结

NeuroLM 通过将 EEG 视为一种‘外语’,利用文本对齐的神经分词器,首次提出了用于 EEG 信号处理的通用多任务基础模型,实现了与大型语言模型(LLMs)的端到端集成。通过多通道自回归预训练和指令微调,该模型在六个不同的 EEG 任务中实现了最先进性能,最大版本(NeuroLM-XL)参数量达 17 亿,预训练数据量达 25,000 小时。

ABSTRACT

Recent advancements for large-scale pre-training with neural signals such as electroencephalogram (EEG) have shown promising results, significantly boosting the development of brain-computer interfaces (BCIs) and healthcare. However, these pre-trained models often require full fine-tuning on each downstream task to achieve substantial improvements, limiting their versatility and usability, and leading to considerable resource wastage. To tackle these challenges, we propose NeuroLM, the first multi-task foundation model that leverages the capabilities of Large Language Models (LLMs) by regarding EEG signals as a foreign language, endowing the model with multi-task learning and inference capabilities. Our approach begins with learning a text-aligned neural tokenizer through vector-quantized temporal-frequency prediction, which encodes EEG signals into discrete neural tokens. These EEG tokens, generated by the frozen vector-quantized (VQ) encoder, are then fed into an LLM that learns causal EEG information via multi-channel autoregression. Consequently, NeuroLM can understand both EEG and language modalities. Finally, multi-task instruction tuning adapts NeuroLM to various downstream tasks. We are the first to demonstrate that, by specific incorporation with LLMs, NeuroLM unifies diverse EEG tasks within a single model through instruction tuning. The largest variant NeuroLM-XL has record-breaking 1.7B parameters for EEG signal processing, and is pre-trained on a large-scale corpus comprising approximately 25,000-hour EEG data. When evaluated on six diverse downstream datasets, NeuroLM showcases the huge potential of this multi-task learning paradigm.

研究动机与目标

  • 解决基于 EEG 的脑机接口和医疗应用中任务特定微调的局限性。
  • 通过使 LLM 能够将神经信号理解为一种‘外语’,弥合语言与 EEG 模态之间的鸿沟。
  • 开发一个统一的、多任务的基础模型,能够在无需任务特定微调的情况下泛化于多种 EEG 任务。
  • 克服 EEG-文本对齐、LLM 内部有效表征学习以及统一多任务学习的挑战。
  • 证明大规模预训练与指令微调可使单一模型有效处理多种 EEG 任务。

提出的方法

  • 通过向量量化的时间-频率预测训练文本对齐的神经分词器,将连续的 EEG 信号转换为离散的神经标记,同时采用对抗训练使 EEG 和文本嵌入对齐。
  • 冻结的向量量化(VQ)编码器提取紧凑的离散 EEG 标记序列,并将其输入预训练的大型语言模型(LLM)。
  • 多通道自回归预训练使 LLM 能够通过跨多个通道预测未来 EEG 标记来学习因果表征。
  • 联合多任务指令微调利用自然语言指令适应模型以应对各种下游 EEG 任务,实现零样本和 few-shot 泛化。
  • 该模型在约 25,000 小时的大规模 EEG 语料库上进行预训练,模型变体从小型到 17 亿参数(NeuroLM-XL)不等。
  • 该框架将 EEG 信号视为标记序列,使 LLM 能够在多种 EEG 模态上执行理解与生成任务。

实验结果

研究问题

  • RQ1EEG 信号能否被有效编码为与自然语言语义对齐的离散标记,使 LLM 能将其作为‘外语’处理?
  • RQ2在 LLM 框架内进行多通道自回归预训练,能否学习到 EEG 信号的因果且可泛化的表征?
  • RQ3单一统一的基础模型能否在无需任务特定微调的情况下,在多种无关的 EEG 任务中实现优异性能?
  • RQ4该模型对指令格式变化(如多项选择题中选项顺序打乱)的鲁棒性如何?
  • RQ5指令数据规模与模型规模对 EEG 信号处理中多任务性能的影响是什么?

主要发现

  • NeuroLM-XL 在六个不同的 EEG 数据集上实现了最先进性能,在 TUSL 数据集上的宏平均 F1 分数为 0.6839 ± 0.0297,优于先前方法。
  • 该模型在不同规模的指令数据下均保持一致性能,表明其在多任务学习中具备鲁棒性与可扩展性。
  • 消融实验表明,多通道自回归预训练显著提升了下游性能,凸显其在学习因果 EEG 表征中的关键作用。
  • 模型在多项选择指令中选项顺序打乱的情况下仍表现出强鲁棒性,表明其对语言上下文具有真正的理解能力,而非仅记忆模式。
  • 验证困惑度持续下降,训练损失稳定收敛,表明所有模型变体均能有效泛化到未见的 EEG 数据。
  • 尽管参数量巨大(17 亿参数),NeuroLM-XL 仍未完全发挥其容量,表明当前预训练数据规模对十亿参数模型而言可能仍显不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。