Skip to main content
QUICK REVIEW

[論文レビュー] Improving self-supervised pretraining models for epileptic seizure detection from EEG data

Sudip Das, Pankaj Pandey|arXiv (Cornell University)|Jun 28, 2022
EEG and Brain-Computer Interfaces被引用数 11
ひとこと要約

本論文では、距離ベースおよび相関ベースのグラフを用いて事前学習タスクを生成することで、自己教師あり事前学習を拡散畳み込み再帰的ニューラルネットワーク(DCRNN)に適用し、EEGデータからのてんかん発作検出を改善している。この手法により、最先端モデル比でAUROCが1.56%向上し、距離ベースのグラフが相関ベースのものよりも安定的かつ正確な結果をもたらした。

ABSTRACT

There is abundant medical data on the internet, most of which are unlabeled. Traditional supervised learning algorithms are often limited by the amount of labeled data, especially in the medical domain, where labeling is costly in terms of human processing and specialized experts needed to label them. They are also prone to human error and biased as a select few expert annotators label them. These issues are mitigated by Self-supervision, where we generate pseudo-labels from unlabelled data by seeing the data itself. This paper presents various self-supervision strategies to enhance the performance of a time-series based Diffusion convolution recurrent neural network (DCRNN) model. The learned weights in the self-supervision pretraining phase can be transferred to the supervised training phase to boost the model's prediction capability. Our techniques are tested on an extension of a Diffusion Convolutional Recurrent Neural network (DCRNN) model, an RNN with graph diffusion convolutions, which models the spatiotemporal dependencies present in EEG signals. When the learned weights from the pretraining stage are transferred to a DCRNN model to determine whether an EEG time window has a characteristic seizure signal associated with it, our method yields an AUROC score $1.56\%$ than the current state-of-the-art models on the TUH EEG seizure corpus.

研究の動機と目的

  • てんかん診断におけるラベル付きEEGデータの不足を、豊富な未ラベル医療データの活用によって解決すること。
  • 自己教師あり事前学習を用いて、監視付きDCRNNモデルのてんかん検出性能を向上させること。
  • 距離ベースおよび相関ベースの異なるグラフ構造が、自己教師あり学習の効果に与える影響を評価すること。
  • 時系列EEGデータのための事前学習タスクの最適化により、モデルの分散を低減し、一般化性能を向上させること。
  • 他の時系列医療信号に適用可能な堅牢で移植可能な自己教師あり学習フレームワークを確立すること。

提案手法

  • TUH EEGてんかんコホートの未ラベルEEGセグメントを用いて、自己教師あり事前学習タスクでDCRNNエンコーダーを事前学習する。
  • 現在の12秒入力から将来の12秒EEGウィンドウを予測するマスク予測タスクを用いる。
  • EEG電極間のユークリッド距離を用いて空間グラフを構築(距離ベース)し、相関に基づく機能的結合性を用いる(相関ベース)。
  • 事前学習済みエンコーダー重みを、てんかん検出のための監視付きDCRNN分類器に転移する。
  • 1台のNVIDIA RTX 5000 GPUでバッチサイズ1500で学習し、先行研究の標準的なハイパーパrameterを用いる。
  • AUROCを用いて性能を評価し、各戦略について5回の独立した実験を実施して統計的信頼性を確保する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり事前学習は、EEGデータからのてんかん発作検出におけるDCRNNモデルの性能を向上させることができるか?
  • RQ2距離ベースと相関ベースの異なるグラフ構築法は、EEG時系列モデリングにおける自己教師あり学習の効果にどのように影響するか?
  • RQ3未ラベルEEGデータでの事前学習は、下流のてんかん分類における分散低減と一般化性能向上に寄与するか?
  • RQ4追加のラベル付きデータを必要とせずに、自己教師あり学習が最先端の性能を達成できるか?
  • RQ5異なる事前学習タスクおよびグラフタイプが、モデルの頑健性およびAUROC性能に果たす相対的寄与度は何か?

主な発見

  • 提案された自己教師あり戦略により、TUH EEGてんかんコホートにおいて、前回の最先端手法比でAUROCが1.56%向上した。
  • 距離ベースのグラフは一貫して相関ベースのグラフを上回り、全実験で高いAUROCと低い標準偏差を達成した。
  • 距離ベースのランダムサンプリング戦略が、テストした5つの自己教師あり学習手法の中で最高の性能を示した。
  • 相関ベースのモデルは高い分散と低い性能を示し、損失関数が早く収束したが、高い値で停止し、早期停止を引き起こし、最適でない結果となった。
  • 事前学習フェーズは、下流学習パイプラインの変更を最小限に抑えつつ、モデルの一般化性能を顕著に向上させた。
  • 再現性が確認された。2つの戦略を2つのグラフタイプで再実行した結果、誤差範囲内に収束した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。