Skip to main content
QUICK REVIEW

[論文レビュー] NeuSpeech: Decode Neural signal as Speech

Yiqian Yang, Yiqun Duan|arXiv (Cornell University)|Mar 4, 2024
Deception detection and forensic psychologyPsychology被引用数 3
ひとこと要約

NeuSpeechは、自己教師学習を用いずに、クロスアテンションベースのWhisperモデルを用いて直接MEG信号からテキストに変換する、最初のエンドツーエンドで教師強制を不要とするフレームワークを提示した。微細な信号トークン化も行わず、GWilliamsデータセットでは60.30 BLEU-1、Schoffelenデータセットでは53.16 BLEU-1を達成し、非侵襲的神経信号からの高性能でオープンボキャブラリーな音声復元を実証した。

ABSTRACT

Decoding language from brain dynamics is an important open direction in the realm of brain-computer interface (BCI), especially considering the rapid growth of large language models. Compared to invasive-based signals which require electrode implantation surgery, non-invasive neural signals (e.g. EEG, MEG) have attracted increasing attention considering their safety and generality. However, the exploration is not adequate in three aspects: 1) previous methods mainly focus on EEG but none of the previous works address this problem on MEG with better signal quality; 2) prior works have predominantly used $``teacher-forcing"$ during generative decoding, which is impractical; 3) prior works are mostly $``BART-based"$ not fully auto-regressive, which performs better in other sequence tasks. In this paper, we explore the brain-to-text translation of MEG signals in a speech-decoding formation. Here we are the first to investigate a cross-attention-based ``whisper" model for generating text directly from MEG signals without teacher forcing. Our model achieves impressive BLEU-1 scores of 60.30 and 52.89 without pretraining $\&$ teacher-forcing on two major datasets ($ extit{GWilliams}$ and $ extit{Schoffelen}$). This paper conducts a comprehensive review to understand how speech decoding formation performs on the neural decoding tasks, including pretraining initialization, training $\&$ evaluation set splitting, augmentation, and scaling law. Code is available at https://github.com/NeuSpeech/NeuSpeech1$.

研究の動機と目的

  • 教師強制に依存せず、エンドツーエンドでオープンボキャブラリーなMEGからテキストへの翻訳を実現すること。これは実世界の推論において現実的でない。
  • 先行のBARTベースで非自己回帰的なアプローチに制限がある中で、完全な自己回帰的Transformer(Whisperベース)モデルを用いた直接的な神経信号から音声への復元の可能性を検討すること。
  • 複数のデータセット、被験者、言語、MEGレイアウトを対象に性能を評価し、一般化性と頑健性を確認すること。
  • データ拡張、事前学習、モデルアーキテクチャの影響を、生のMEG信号を用いて検証すること。

提案手法

  • 生のMEG波形を直接テキストトークンにマッピングするため、Whisper ASRモデルにインspiredされたクロスアテンションベースのエンコーダーデコーダー構造を採用する。
  • 特徴抽出を強化し、時間的解像度を低下させるために、2つの初期畳み込み層とポイントワイド畳み込みを組み込んだ変更版Whisperエンコーダーを採用する。
  • 訓練中にブロックマスキングと低SNRノイズ拡張を用いることで、信号劣化に対する耐性を高め、一般化性能を向上させる。
  • イベントマーカーや離散的コード表現を一切使用せず、生のMEG信号上でエンドツーエンドに学習を実行し、直接シーケンスからシーケンスへの生成を可能にする。
  • MEGデータに対する事前学習を一切行わず、生の神経信号と言語の事前知識に依存してモデルが学習する能力に依存する。
  • 評価には標準的な翻訳指標(BLEU-1、ROUGE-1)を用い、ホールドアウトされたテストセットを用いてゼロショット一般化と頑健性を評価する。
Figure 1: Performance on different model sizes. Black numbers represent the BLEU-1 score, green numbers are effective epochs after which the evaluation loss does not descend. Note that each experiment runs 120 epochs.
Figure 1: Performance on different model sizes. Black numbers represent the BLEU-1 score, green numbers are effective epochs after which the evaluation loss does not descend. Note that each experiment runs 120 epochs.

実験結果

リサーチクエスチョン

  • RQ1完全な自己回帰的Transformerモデルは、教師強制なしで高性能なMEGからテキストへの翻訳を達成できるか?
  • RQ2Whisperベースのアーキテクチャにおけるクロスアテンションは、先行のBARTベースのモデルと比較して、生のMEG信号の復元においてどのように異なるか?
  • RQ3ブロックマスキングやノイズ注入などのデータ拡張戦略の中で、ノイズの多いMEGデータに対するモデルの頑健性と性能向上に最も寄与するのはどれか?
  • RQ4微調整なしで、異なる被験者、MEGレイアウト、言語にわたってモデルがどれほど一般化できるか?
  • RQ5事前学習が存在しない状況での性能への影響は何か?また、モデルのアーキテクチャは、生のMEG信号から意味的な表現を学習する上で果たす役割は何か?

主な発見

  • 教師強制や事前学習なしで、GWilliamsデータセットでは60.30 BLEU-1および55.26 ROUGE-1 F-measureを達成し、強力なゼロショット生成能力を示した。
  • Schoffelenデータセットでは53.16 BLEU-1を達成し、複数のMEGデータセットおよび被験者にわたって一貫した性能を確認した。
  • 小さなマスク率を用いたブロックマスキングと低SNRノイズ拡張は、モデルの一般化性能を顕著に向上させた。0dB SNRの強いノイズは、ノイズ耐性を高めるため、性能向上に寄与した可能性がある。
  • エンコーダー内のポイントワイド畳み込み層を削除すると、性能が著しく低下(BLEU-1は41.65から34.81に低下)し、特徴学習におけるその重要性を示した。
  • 訓練データの増加とより多くの微調整対象層の採用により性能が向上したため、スケーラビリティが確認され、より大きなデータと深層な適応によりさらなる向上が期待できる。
  • 時間的シフトによるデータ拡張は効果がなく、性能を低下させた。これは、時間的シフトがモデルがMEG信号パターンを学習する能力を損なう可能性を示唆している。
Figure 2: Performance changes with different data augmentations. The probability means the likelihood of adding augmentation on each data segment.
Figure 2: Performance changes with different data augmentations. The probability means the likelihood of adding augmentation on each data segment.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。