Skip to main content
QUICK REVIEW

[論文レビュー] BIOT: Cross-data Biosignal Learning in the Wild

Chaoqi Yang, M. Brandon Westover|arXiv (Cornell University)|May 10, 2023
EEG and Brain-Computer Interfaces被引用数 4
ひとこと要約

本論文では、異なるチャネル数、可変長、欠損値を有する多様なデータセット間でバイオシグナル学習を可能にするBIOTというバイオシグナルトランスフォーマーモデルを提案する。各シグナルチャネルを固定長のセグメントにトークン化し、それらを統一された「バイオシグナル文」にフラット化することで実現される。このモデルは、異種バイオシグナルデータ上で事前学習されたモデルからの転移学習により、てんかん検出タスクで最大4%のバランス精度向上を達成し、最先端の性能を示している。

ABSTRACT

Biological signals, such as electroencephalograms (EEG), play a crucial role in numerous clinical applications, exhibiting diverse data formats and quality profiles. Current deep learning models for biosignals are typically specialized for specific datasets and clinical settings, limiting their broader applicability. Motivated by the success of large language models in text processing, we explore the development of foundational models that are trained from multiple data sources and can be fine-tuned on different downstream biosignal tasks. To overcome the unique challenges associated with biosignals of various formats, such as mismatched channels, variable sample lengths, and prevalent missing values, we propose a Biosignal Transformer (\method). The proposed \method model can enable cross-data learning with mismatched channels, variable lengths, and missing values by tokenizing diverse biosignals into unified "biosignal sentences". Specifically, we tokenize each channel into fixed-length segments containing local signal features, flattening them to form consistent "sentences". Channel embeddings and {\em relative} position embeddings are added to preserve spatio-temporal features. The \method model is versatile and applicable to various biosignal learning settings across different datasets, including joint pre-training for larger models. Comprehensive evaluations on EEG, electrocardiogram (ECG), and human activity sensory signals demonstrate that \method outperforms robust baselines in common settings and facilitates learning across multiple datasets with different formats. Use CHB-MIT seizure detection task as an example, our vanilla \method model shows 3\% improvement over baselines in balanced accuracy, and the pre-trained \method models (optimized from other data sources) can further bring up to 4\% improvements.

研究の動機と目的

  • 不一致するチャネル数、可変長、欠損値を含む、フォーマットが不一致するバイオシグナルデータ上で深層学習モデルを訓練する課題に対処すること。
  • 広範なバイオシグナルデータセット間で知識を転送可能な、統一的かつ柔軟なフレームワークを構築すること。
  • 複数のバイオシグナルソース(例:EEG、ECG)を統合的に事前学習することで、下流の臨床タスクに向けた基盤的モデルの可能性を検討すること。
  • 自己教師付きおよび教師あり事前学習戦略の両方が、下流のバイオシグナル分類性能を向上させるかを評価すること。
  • 最小限のファインチューニングで複数のバイオシグナルモodalitiesおよび臨床タスクに一般化可能な、単一のモデルアーキテクチャが有効であることを実証すること。

提案手法

  • BIOTは、各チャネルを固定長の時間的セグメントに分割し、局所的シグナル特徴を抽出することで一貫性のある「バイオシグナル文」を形成する、画期的なバイオシグナルトークン化モジュールを導入する。
  • 空間的および時間的関係を保持するために、チャネル埋め込みと相対的位置埋め込みを適用する。
  • フラット化されたトークン化バイオシグナル系列を処理するため、標準的なトランスフォーマーエンコーダーを用い、空間的(チャネル)および時間的(セグメント)次元の両方におけるアテンションを可能にする。
  • 入力のチャネル数や継続時間に関わらず、すべての入力をトークンの系列として扱うことで、異なるフォーマットのデータセットを統合的に事前学習可能である。
  • 大規模なラベルなしバイオシグナルデータ上でコントラスト学習の目的関数を用いて事前学習を行い、その後、下流の分類タスクでファインチューニングを実施する。
  • 教師ありおよび自己教師付き事前学習をサポートし、EEG、ECG、アクティビティモニタリングシグナルなど、多様なデータソースからの転移学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1異なるチャネル数、サンプリングレート、長さを有する極めて可変的なフォーマットのバイオシグナルを、単一のディープラーニングモデルが効果的に符号化できるか。
  • RQ2異なる特性(例:異なるチャネル数や記録時間)を持つバイオシグナルデータセット間で、知識をどれほど転送できるか。
  • RQ3異種バイオシグナルデータセットを統合的に事前学習することで、個別に学習した場合と比較して下流タスクの性能が向上するか。
  • RQ4事前学習データの選択(例:サイズ、モダリティ、フォーマット)が、下流タスクでのファインチューニング性能に与える影響は。
  • RQ5大規模なラベルなしバイオシグナルで自己教師付き事前学習を行うことで、より小さなタスク固有のデータセットで教師あり事前学習を行うよりも優れた性能が得られるか。

主な発見

  • ヴァニラBIOTモデルは、CHB-MITてんかん検出タスクにおいて、強力なベースラインと比較してバランス精度が3%向上した。
  • 下流タスクでファインチューニングされた事前学習済みBIOTモデルは、非事前学習ベースラインと比較して、バランス精度が最大4%向上した。
  • 500万件のPRESTおよび500万件のSHHS EEGサンプル(PREST+SHHS)を統合的に事前学習することで、下流のEEGタスクでの性能が著しく向上し、初期学習からの学習と比較して顕著な改善が得られた。
  • 12リードECGデータ(Cardiology-12)を用いた事前学習は、6リード(Cardiology-6)のみを用いた場合よりも優れた性能を示し、より多くのデータが有効であることを示した。
  • てんかん関連データセット(例:IIIC Seizure, TUAB)で教師あり事前学習を行うと、睡眠や安静時のEEGデータで自己教師付き事前学習を行うよりも、TUEVてんかん検出タスクで優れた性能が得られた。
  • 6つのEEGデータセット(6 EEG datasets)で事前学習したモデルは、自己教師付きおよび教師あり事前学習バージョンを上回り、包括的なマルチソース事前学習の利点を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。