Skip to main content
QUICK REVIEW

[논문 리뷰] NeuSpeech: Decode Neural signal as Speech

Yiqian Yang, Yiqun Duan|arXiv (Cornell University)|2024. 03. 04.
Deception detection and forensic psychologyPsychology인용 수 3
한 줄 요약

NeuSpeech는 교사 유도 없이 직접 MEG에서 텍스트로의 번역을 위한 첫 번째 엔드 투 엔드 프레임워크를 제안하며, 크로스 어텐션 기반의 Whisper 모델을 사용하여 사전 훈련 없이도 이산 신호 토큰화 없이 60.30 BLEU-1의 성능을 달성했으며, GWilliams 데이터셋에서, Schoffelen에서는 53.16 BLEU-1의 성능을 기록하여 비침습적 뇌신호에서 고성능의 오픈 어휘 음성 복원이 가능함을 입증함.

ABSTRACT

Decoding language from brain dynamics is an important open direction in the realm of brain-computer interface (BCI), especially considering the rapid growth of large language models. Compared to invasive-based signals which require electrode implantation surgery, non-invasive neural signals (e.g. EEG, MEG) have attracted increasing attention considering their safety and generality. However, the exploration is not adequate in three aspects: 1) previous methods mainly focus on EEG but none of the previous works address this problem on MEG with better signal quality; 2) prior works have predominantly used $``teacher-forcing"$ during generative decoding, which is impractical; 3) prior works are mostly $``BART-based"$ not fully auto-regressive, which performs better in other sequence tasks. In this paper, we explore the brain-to-text translation of MEG signals in a speech-decoding formation. Here we are the first to investigate a cross-attention-based ``whisper" model for generating text directly from MEG signals without teacher forcing. Our model achieves impressive BLEU-1 scores of 60.30 and 52.89 without pretraining $\&$ teacher-forcing on two major datasets ($ extit{GWilliams}$ and $ extit{Schoffelen}$). This paper conducts a comprehensive review to understand how speech decoding formation performs on the neural decoding tasks, including pretraining initialization, training $\&$ evaluation set splitting, augmentation, and scaling law. Code is available at https://github.com/NeuSpeech/NeuSpeech1$.

연구 동기 및 목표

  • 실제 추론 환경에서 교사 유도가 비현실적이므로, 교사 유도에 의존하지 않고 엔드 투 엔드로 오픈 어휘 MEG에서 텍스트로의 번역을 가능하게 하는 것.
  • 기존의 BART 기반의 비자기적 접근 방식의 한계를 극복하고, 직접 신경 신호에서 음성으로의 복원을 위한 전면 자기적 트랜스포머(Whisper 기반) 모델의 타당성을 탐색하는 것.
  • 일관성과 강건성을 확보하기 위해 다양한 데이터셋, 피험자, 언어, MEG 레이아웃을 기반으로 성능을 평가하는 것.
  • 데이터 증강, 사전 훈련, 모델 아키텍처가 원시 MEG 신호에서의 복원 성능에 미치는 영향을 조사하는 것.

제안 방법

  • 원시 MEG 파형을 직접 텍스트 토큰으로 매핑하기 위해 Whisper ASR 모델에서 영감을 얻은 크로스 어텐션 기반의 인코더-디코더 아키텍처를 채택함.
  • 특징 추출 및 시간 해상도 감소를 향상시키기 위해 두 개의 초기 컨볼루션 레이어와 포인트와이즈 컨볼루션을 적용한 수정된 Whisper 인코더를 사용함.
  • 신호 열화에 대한 강건성 향상과 일반화 능력 향상을 위해 훈련 중에 블록 마스킹과 저SNR 노이즈 증강을 적용함.
  • 이벤트 마커나 이산 코드 표현 없이 원시 MEG 신호에서 엔드 투 엔드로 훈련하여 직접 순서에서 순서로의 생성을 가능하게 함.
  • MEG 데이터에 대한 사전 훈련을 적용하지 않으며, 원시 뇌신호와 언어 사전 지식에서만 학습할 수 있는 모델의 능력에 의존함.
  • 평가에 표준 번역 지표(BLEU-1, ROUGE-1)를 사용하며, 보류된 테스트 세트를 통해 제로샷 일반화 및 강건성 평가를 수행함.
Figure 1: Performance on different model sizes. Black numbers represent the BLEU-1 score, green numbers are effective epochs after which the evaluation loss does not descend. Note that each experiment runs 120 epochs.
Figure 1: Performance on different model sizes. Black numbers represent the BLEU-1 score, green numbers are effective epochs after which the evaluation loss does not descend. Note that each experiment runs 120 epochs.

실험 결과

연구 질문

  • RQ1전면 자기적 트랜스포머 모델이 교사 유도 없이도 고성능의 MEG에서 텍스트로의 번역을 달성할 수 있는가?
  • RQ2Whisper 기반 아키텍처에서의 크로스 어텐션은 기존의 BART 기반 모델 대비 원시 MEG 신호 복원에서 어떻게 성능을 높이는가?
  • RQ3블록 마스킹, 노이즈 주입 등의 데이터 증강 전략 중에서 어떤 것이 노이즈가 많은 MEG 데이터에서 모델의 강건성과 성능 향상에 가장 효과적인가?
  • RQ4피험자, MEG 레이아웃, 언어 간에 피팅 조정 없이 얼마나 잘 일반화되는가?
  • RQ5사전 훈련이 없을 경우 성능에 어떤 영향을 미치며, 모델 아키텍처는 원시 MEG에서 의미 있는 의미 표현을 학습하는 데 어떤 역할을 하는가?

주요 결과

  • NeuSpeech는 교사 유도 없이도 GWilliams 데이터셋에서 60.30 BLEU-1 및 55.26 ROUGE-1 F-measure 성능을 기록하여 강력한 제로샷 생성 능력을 입증함.
  • Schoffelen 데이터셋에서는 53.16 BLEU-1 성능을 기록하여 다양한 MEG 데이터셋과 피험자 간에서 일관된 성능을 확보함.
  • 작은 마스크 비율을 가진 블록 마스킹과 저SNR 노이즈 증강이 모델의 일반화 능력을 크게 향상시키며, 강한 노이즈(0dB SNR)는 노이즈 강건성 향상로 인해 성능 향상을 유도함.
  • 인코더에서 포인트와이즈 컨볼루션 레이어를 제거하면 성능이 크게 저하됨(60.30에서 34.81 BLEU-1로 감소), 이는 특징 학습에서의 중요성을 강조함.
  • 훈련 데이터 증가와 더 많은 미세조정 레이어 사용에 따라 성능 향상이 관찰되어, 더 큰 데이터와 깊은 적응을 통해 향후 성능 향상 가능성이 있음.
  • 데이터 증강을 위한 시간 이동은 도움이 되지 않으며 성능 저하를 유발함으로써, 시간 이동이 모델이 MEG 신호 패턴을 학습하는 능력을 방해할 수 있음.
Figure 2: Performance changes with different data augmentations. The probability means the likelihood of adding augmentation on each data segment.
Figure 2: Performance changes with different data augmentations. The probability means the likelihood of adding augmentation on each data segment.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.