[论文解读] Large Transformers are Better EEG Learners
本文提出 AdaCE,一种即插即用的适配器框架,可将多通道 EEG 信号转换为图像或文本格式,从而实现对大规模预训练视觉与语言 Transformer 模型的直接微调,用于基于 EEG 的预测任务。通过利用无需额外可训练参数的预训练模型(如 Swin-Transformer 和 GPT-2),AdaCE 实现了最先进性能,包括在 UCI HAR 数据集上达到 99.6% 的准确率——比先前方法高出 9.2%——表明当使用 AdaCE 微调时,更大的预训练模型可带来性能提升。
Pre-trained large transformer models have achieved remarkable performance in the fields of natural language processing and computer vision. However, the limited availability of public electroencephalogram (EEG) data presents a unique challenge for extending the success of these models to EEG-based tasks. To address this gap, we propose AdaCT, plug-and-play Adapters designed for Converting Time series data into spatio-temporal 2D pseudo-images or text forms. Essentially, AdaCT-I transforms multi-channel or lengthy single-channel time series data into spatio-temporal 2D pseudo-images for fine-tuning pre-trained vision transformers, while AdaCT-T converts short single-channel data into text for fine-tuning pre-trained language transformers. The proposed approach allows for seamless integration of pre-trained vision models and language models in time series decoding tasks, particularly in EEG data analysis. Experimental results on diverse benchmark datasets, including Epileptic Seizure Recognition, Sleep-EDF, and UCI HAR, demonstrate the superiority of AdaCT over baseline methods. Overall, we provide a promising transfer learning framework for leveraging the capabilities of pre-trained vision and language models in EEG-based tasks, thereby advancing the field of time series decoding and enhancing interpretability in EEG data analysis. Our code will be available at https://github.com/wangbxj1234/AdaCE.
研究动机与目标
- 为解决标注 EEG 数据有限的问题,利用来自视觉与自然语言处理领域的大型预训练 Transformer 模型进行 EEG 解码。
- 在将 EEG 信号适配至预训练模型时,完整保留其时空信息,且不引入额外可训练参数。
- 证明使用 AdaCE 微调更大规模的预训练模型可提升 EEG 预测任务的性能。
- 提供一种即插即用的解决方案,可适用于 EEG 以外的其他多通道时间序列数据。
提出的方法
- 设计 AdaCE-to-Image 适配器,将二维多通道 EEG 数据转换为类似图像的张量,输入至预训练视觉 Transformer 模型。
- 设计 AdaCE-to-Text 适配器,将中等长度单通道 EEG 转换为分词后的文本序列,解决 LLM 的输入长度溢出问题。
- 在不修改架构的前提下使用预训练视觉与语言模型(如 Swin-Transformer、GPT-2),仅通过适配器模块进行微调。
- 以即插即用方式应用适配器,使原始 EEG 数据可直接输入至预训练模型,无需额外特征提取网络。
- 在所有模型上采用一致的训练设置,以确保模型规模与性能提升关系的公平比较。
- 在 EEG 转图像转换中采用 224×224 分辨率与 RGB 模式,以匹配视觉 Transformer 的输入要求。

实验结果
研究问题
- RQ1在不修改架构或引入额外可训练参数的前提下,预训练视觉与语言 Transformer 是否可有效微调用于 EEG 解码?
- RQ2通过适配器将 EEG 数据转换为图像或文本形式,是否能保留足够信息以实现 EEG 预测任务的最先进性能?
- RQ3在使用 AdaCE 的情况下,增大预训练模型规模是否能提升 EEG 任务的性能?
- RQ4所提出的 AdaCE 框架是否可泛化至其他多通道时间序列数据(如 ECG 和 EMG)?
主要发现
- AdaCE-to-Image 在 UCI HAR 数据集上达到 99.6% 的准确率,相比先前方法绝对提升 9.2%。
- 使用 AdaCE 微调更大规模的预训练视觉 Transformer(如含 8700 万参数的 Swin-Transformer)可获得 99.6% 的准确率,高于较小变体(2800 万参数的模型为 98.2%)。
- AdaCE-to-Text 在 Sleep-EDF 数据集上优于先前的 EEG-to-text 方法,但在多通道 EEG 任务中表现不及 AdaCE-to-Image。
- AdaCE-to-Image 与 AdaCE-to-Text 的性能差距在 UCI HAR 数据集上最为显著,凸显图像表示在多通道 EEG 中的优越性。
- 当使用 AdaCE 微调时,参数量相近但架构不同的预训练模型(如 DeiT、ViT、Swin)表现相当,表明对架构差异具有鲁棒性。
- 实验结果证实,使用 AdaCE 微调更大规模的预训练模型可获得更好性能,表明其在扩展至更大模型方面具有强大潜力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。