Skip to main content
QUICK REVIEW

[論文レビュー] Large Transformers are Better EEG Learners

Bingxin Wang, Xiaowen Fu|arXiv (Cornell University)|Aug 20, 2023
EEG and Brain-Computer Interfaces被引用数 4
ひとこと要約

本稿では、多チャネルEEG信号を画像またはテキスト形式に変換することで、大規模な事前学習済み視覚および言語トランスフォーマーを直接微調整可能にする、プラグアンドプレイ型アダプタフレームワークAdaCEを提案する。Swin-Transformer や GPT-2 といった事前学習モデルを、追加の可学習パラメータを追加せずに活用することで、AdaCEは、99.6%の正確度を達成する最先端の性能を実現した。これは、従来手法よりも9.2%高い性能であり、AdaCEで微調整された大規模な事前学習モデルが、EEGベースの予測タスクにおいてより優れた性能を示すことを実証している。

ABSTRACT

Pre-trained large transformer models have achieved remarkable performance in the fields of natural language processing and computer vision. However, the limited availability of public electroencephalogram (EEG) data presents a unique challenge for extending the success of these models to EEG-based tasks. To address this gap, we propose AdaCT, plug-and-play Adapters designed for Converting Time series data into spatio-temporal 2D pseudo-images or text forms. Essentially, AdaCT-I transforms multi-channel or lengthy single-channel time series data into spatio-temporal 2D pseudo-images for fine-tuning pre-trained vision transformers, while AdaCT-T converts short single-channel data into text for fine-tuning pre-trained language transformers. The proposed approach allows for seamless integration of pre-trained vision models and language models in time series decoding tasks, particularly in EEG data analysis. Experimental results on diverse benchmark datasets, including Epileptic Seizure Recognition, Sleep-EDF, and UCI HAR, demonstrate the superiority of AdaCT over baseline methods. Overall, we provide a promising transfer learning framework for leveraging the capabilities of pre-trained vision and language models in EEG-based tasks, thereby advancing the field of time series decoding and enhancing interpretability in EEG data analysis. Our code will be available at https://github.com/wangbxj1234/AdaCE.

研究の動機と目的

  • 視覚および自然言語処理分野の大きな事前学習済みトランスフォーマーを活用することで、ラベル付きEEGデータが限られているという課題に対処すること。
  • 追加の可学習パラメータを導入せずに、EEG信号の完全な空間的・時間的情報をアダプトする際に保持すること。
  • AdaCEで大規模な事前学習済みモデルを微調整することで、EEG予測タスクにおける性能が向上することを示すこと。
  • EEGにとどまらず、他の多チャネル時系列データにも適用可能なプラグアンドプレイ型ソリューションを提供すること。

提案手法

  • 2次元多チャネルEEGデータを、事前学習済み視覚トランスフォーマーの入力に適した画像に似たテンソルに変換するAdaCE-to-Imageアダプタの設計。
  • 中程度の単一チャネルEEGをトークン化されたテキストシーケンスに変換するAdaCE-to-Textアダプタの設計。これにより、LLMの入力長制限問題が解決される。
  • アーキテクチャの変更なしに、事前学習済みの視覚および言語モデル(例:Swin-Transformer、GPT-2)を用い、アダプタモジュールでのみ微調整する。
  • アダプタをプラグアンドプレイ形式で適用し、追加の特徴抽出ネットワークを必要とせず、生のEEGデータを直接事前学習済みモデルに入力可能にする。
  • モデルサイズのスケーリングに関する性能比較を公平に行うために、全モデルで一貫した訓練設定を採用する。
  • 視覚トランスフォーマーの入力要件を満たすために、EEGから画像への変換に224×224の解像度とRGBパターンを用いる。
Figure 1: Framework: Adapters to convert EEG into images and text for fine-tuning pre-trained large transformers.
Figure 1: Framework: Adapters to convert EEG into images and text for fine-tuning pre-trained large transformers.

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャの変更や追加の可学習パラメータなしに、事前学習済み視覚および言語トランスフォーマーをEEGデコードに効果的に微調整できるか?
  • RQ2アダプタを介してEEGデータを画像またはテキスト形式に変換することで、EEG予測タスクにおける最先端の性能を十分に維持できるか?
  • RQ3AdaCEを用いて事前学習モデルのサイズを拡大すると、EEGタスクにおける性能が向上するか?
  • RQ4提案されたAdaCEフレームワークは、ECG や EMG などの他の多チャネル時系列データにも一般化可能か?

主な発見

  • AdaCE-to-ImageはUCI HARデータセットで99.6%の正確度を達成し、従来手法よりも9.2%の絶対的向上を示した。
  • AdaCEで微調整した大規模な事前学習済み視覚トランスフォーマー(例:8700万パラメータのSwin-Transformer)は、小規模バージョン(2800万パラメータ)よりも高い正確度(99.6%)を達成した。
  • AdaCE-to-TextはSleep-EDFデータセットで、従来のEEG-to-テキスト手法を上回ったが、多チャネルEEGタスクではAdaCE-to-Imageに劣った。
  • AdaCE-to-ImageとAdaCE-to-Textの性能差は、UCI HARデータセットで最も顕著であり、多チャネルEEGに対して画像ベース表現が優れていることを示している。
  • パラメータ数は類似しているがアーキテクチャが異なるモデル(例:DeiT、ViT、Swin)がAdaCEで微調整された場合、同等の性能を達成した。これは、アーキテクチャの違いに対して高いロバスト性を示している。
  • 結果は、AdaCEで微調整された大規模な事前学習モデルが、より優れた性能を示すことを実証的に確認しており、さらに大規模なモデルへのスケーリングの可能性が非常に高いことを示唆している。
Figure 2: AdaCE-to-Image: Adapter for Converting EEG into images to maintain the complete feature information.
Figure 2: AdaCE-to-Image: Adapter for Converting EEG into images to maintain the complete feature information.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。