Skip to main content
QUICK REVIEW

[論文レビュー] Decoding speech perception from non-invasive brain recordings

Alexandre Défossez, Charlotte Caucheteux|arXiv (Cornell University)|Aug 25, 2022
EEG and Brain-Computer Interfaces参考文献 91被引用数 9
ひとこと要約

本論文では、175名の健常者からなる被験者群における非侵襲的MEGおよびEEG記録から、知覚された言語を復元するためのコントラスト学習に基づく深層ニューラルネットワークを提案する。自己教師あり音声表現(wav2vec 2.0)とマルチ被験者・共有畳み込みアーキテクチャを活用することで、3秒間のMEGデータから、未学習の語句やフレーズのゼロショット復元が可能となり、最大41%のトップ1精度を達成。これは侵襲的アプローチに匹敵する性能を示している。

ABSTRACT

Decoding speech from brain activity is a long-awaited goal in both healthcare and neuroscience. Invasive devices have recently led to major milestones in that regard: deep learning algorithms trained on intracranial recordings now start to decode elementary linguistic features (e.g. letters, words, spectrograms). However, extending this approach to natural speech and non-invasive brain recordings remains a major challenge. Here, we introduce a model trained with contrastive-learning to decode self-supervised representations of perceived speech from the non-invasive recordings of a large cohort of healthy individuals. To evaluate this approach, we curate and integrate four public datasets, encompassing 175 volunteers recorded with magneto- or electro-encephalography (M/EEG), while they listened to short stories and isolated sentences. The results show that our model can identify, from 3 seconds of MEG signals, the corresponding speech segment with up to 41% accuracy out of more than 1,000 distinct possibilities on average across participants, and more than 80% in the very best participants - a performance that allows the decoding of words and phrases absent from the training set. The comparison of our model to a variety of baselines highlights the importance of (i) a contrastive objective, (ii) pretrained representations of speech and (iii) a common convolutional architecture simultaneously trained across multiple participants. Finally, the analysis of the decoder's predictions suggests that they primarily depend on lexical and contextual semantic representations. Overall, this effective decoding of perceived speech from non-invasive recordings delineates a promising path to decode language from brain activity, without putting patients at risk for brain surgery.

研究の動機と目的

  • 脳手術や侵襲的電極を必要とせず、知覚された言語を復元する非侵襲的脳インターフェース(BCI)の開発。
  • 非侵襲的記録(MEG/EEG)のノイズが多く変動する特性に起因する課題を、マルチ被験者・コントラスト学習フレームワークを用いて克服。
  • トレーニングセットに含まれない語句やフレーズのゼロショット復元を、共有された高次元の言語的表現を用いて実現。
  • 成功した復元の背後にある脳信号成分(語彙的、意味的)を特定し、将来のBCI設計に寄与。
  • 健常者における非侵襲的脳活動から言語知覚を復元する再現可能でスケーラブルなパイプラインの確立。

提案手法

  • MEG/EEGからの深層脳活動表現と、56,000時間の音声データで事前学習されたwav2vec 2.0の自己教師あり音声埋め込みを、コントラスト学習の目的関数で一致させる。
  • 175名の被験者を対象に、共通のマルチ被験者畳み込みニューラルネットワーク(「被験者レイヤー」を備える)を訓練し、個人差を低減し、一般化性能を向上。
  • モデルは3秒間のMEG/EEGセグメントを入力とし、事前学習済みのwav2vec 2.0モデルからの文脈的音声表現を予測する。
  • デコーダは、一致する音声セグメントに対して脳活動と音声埋め込みの類似度を最大化し、不一致ペアに対しては最小化するように訓練。
  • ノイズの多い非侵襲的記録から、頑健で分離可能な知覚された言語表現を学習するため、コントラスト損失関数を用いる。
  • 4つの公的M/EEGデータセット(合計175名)を統合し、短編小説および分離文の記録を用いる。

実験結果

リサーチクエスチョン

  • RQ1大規模な健常者被験者群を対象にトレーニングされた1つのディープラーニングモデルが、非侵襲的MEGおよびEEG信号から知覚された言語を復元できるか?
  • RQ2自己教師あり音声表現とマルチ被験者トレーニングを用いる場合、コントラスト学習が復元性能を向上させるか?
  • RQ3モデルの予測が、低レベルの音響特徴ではなく、語彙的および意味的特徴にどれほど依存しているか?
  • RQ4トレーニング中に見られなかった語句やフレーズのゼロショット復元にモデルが一般化できるか?
  • RQ5MEGとEEG間の性能差が、信号品質および脳源局在化の限界をどのように反映しているか?

主な発見

  • 3秒間のMEGデータから、被験者全体で最大41%のトップ1精度を達成。最良の被験者では80%以上の精度を示した。
  • MEGではトップ10精度が1,594セグメント中72.5%、EEGでは2,604セグメント中19.1%に達し、未学習の語句やフレーズの頑健なゼロショット復元を実証。
  • コントラスト学習の目的関数、事前学習済み音声表現、および被験者間で共同訓練されたマルチ被験者畳み込みアーキテクチャのおかげで、モデル性能が顕著に向上。
  • デコーダの予測分析から、モデルは低レベルの音響特徴ではなく、高次元の語彙的および文脈的意味的表現に主に依存していることが判明。
  • MEGはEEGを著しく上回り、トップ10精度がMEGでEEGの3.8倍にのぼり、信号品質が復元性能に与える影響を強調。
  • 分離語の復元では、平均でトップ1精度22.7%(最良被験者で42.9%)を達成。これは侵襲的手法(例:[66] で39.5%)と同等であり、臨床的応用への強い可能性を示唆。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。