[論文レビュー] SleepFM: Multi-modal Representation Learning for Sleep Across Brain Activity, ECG and Respiratory Signals
SleepFM は、14,000 人の参加者から得られた 100,000 時間を超える匿名化された多導睡眠図データを用いて、脳波活動(EEG)、心電図(ECG)、呼吸信号からの統合的表現を学ぶために、独創的な1つずつ除外する対照的学習アプローチを採用したマルチモーダル基盤モデルである。睡眠段階分類(AUROC 0.88 対 0.72)および睡眠時低炭素血症の検出(AUROC 0.85 対 0.69)において、エンドツーエンドの CNN よりも優れた性能を示し、強力な汎化性能とマルチモーダル間検索性能を実証した。
Sleep is a complex physiological process evaluated through various modalities recording electrical brain, cardiac, and respiratory activities. We curate a large polysomnography dataset from over 14,000 participants comprising over 100,000 hours of multi-modal sleep recordings. Leveraging this extensive dataset, we developed SleepFM, the first multi-modal foundation model for sleep analysis. We show that a novel leave-one-out approach for contrastive learning significantly improves downstream task performance compared to representations from standard pairwise contrastive learning. A logistic regression model trained on SleepFM's learned embeddings outperforms an end-to-end trained convolutional neural network (CNN) on sleep stage classification (macro AUROC 0.88 vs 0.72 and macro AUPRC 0.72 vs 0.48) and sleep disordered breathing detection (AUROC 0.85 vs 0.69 and AUPRC 0.77 vs 0.61). Notably, the learned embeddings achieve 48% top-1 average accuracy in retrieving the corresponding recording clips of other modalities from 90,000 candidates. This work demonstrates the value of holistic multi-modal sleep modeling to fully capture the richness of sleep recordings. SleepFM is open source and available at https://github.com/rthapa84/sleepfm-codebase.
研究の動機と目的
- 脳波活動、ECG、呼吸信号を統合して、全身的な生理的ダイナミクスを捉える睡眠分析のためのマルチモーダル基盤モデルを開発すること。
- 睡眠データにおける表現学習を向上させるために、新たな1つずつ除外する対照的学習フレームワークを導入し、下流タスクの性能を向上させること。
- 学習された表現が、多様な臨床施設およびデータ収集プロトコル間でどのように汎化するかを実証すること。
- 大規模かつ匿名化された多導睡眠図データを用いて、睡眠医学における自己教師ありマルチモーダル学習のベンチマークを確立すること。
- オープンソースコードの公開と医療AIにおける倫理基準の確保を通じて、より広範な臨床応用を可能にすること。
提案手法
- モデルは、1つのモダリティを一時的にマスクすることで、マルチモーダルな整合性と統合的表現学習を促進する、独創的な1つずつ除外する対照的学習目的関数を用いて事前学習される。
- 比較のためのベースラインとして、同一サンプルのモダリティ間変換から得られるポジティブペアを用いた標準的なペアワイズ対照的学習が用いられる。
- モデルは、シアンジアエンコーダー構造を活用し、多モーダル信号(BAS、ECG、呼吸)を共有の潜在空間に埋め込む。
- 事前学習は、スタンフォード睡眠クリニックから得られた 14,000 人の参加者および 100,000 時間を超える多モーダル睡眠記録の大型データセットを用いて実施される。
- 下流タスクには、睡眠段階分類、SDB検出、人口統計的属性予測、および学習済み埋め込みを用いたマルチモーダル間検索(ロジスティック回帰)が含まれる。
- 外部検証は、CinCチャレンジの別データセットを用いて実施され、異なる機関およびデータ収集プロトコル間での汎化性能が評価される。

実験結果
リサーチクエスチョン
- RQ1脳波活動、ECG、呼吸信号から構成されるマルチモーダル基盤モデルは、標準的な対照的学習と比較して、睡眠分析のための表現学習をどのように向上させるか?
- RQ2提案された1つずつ除外する対照的学習アプローチは、睡眠段階分類およびSDB検出においてペアワイズ対照的学習を上回る下流タスク性能を達成するか?
- RQ3学習された埋め込み表現が、異なるデータ収集プロトコルおよびモダリティを持つ外部データセットへどの程度汎化可能か?
- RQ4例えば、EEG埋め込みから対応するECGクリップを検索するようなマルチモーダル間検索において、モデルはどの程度効果的か?
- RQ5臨床的関連性の高い睡眠タスクにおいて、この基盤モデルはエンドツーエンドで訓練された深層ニューラルネットワークを上回る性能を示すか?
主な発見
- SleepFM は、睡眠段階分類においてマクロ平均 AUROC 0.88 を達成し、エンドツーエンド CNN(AUROC 0.72)を著しく上回った。
- 睡眠時低炭素血症検出においては、SleepFM が AUROC 0.85 を達成したのに対し、CNN ベースラインは 0.69 であった。
- 90,000 個の候補から、モダリティ間で対応する記録クリップを検索するタスクで、平均トップ1正答率 48% を達成し、強力なマルチモーダル整合性を示した。
- 1つずつ除外する対照的学習アプローチは、すべての下流タスクでペアワイズ対照的学習を上回り、多モーダル信号の統合がより良好に行われていることを示した。
- CinCデータセットにおける外部検証では、SleepFM が AUROC 0.924、AUPRC 0.759 を達成したのに対し、CNN はそれぞれ 0.843 および 0.553 を記録し、堅牢な汎化性能を示した。
- モデルは多様な人口統計的グループにおいても優れた性能を示し、訓練サイトとテストサイトのEEGチャネル構成の違いに対しても、良好に汎化した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。