Skip to main content
QUICK REVIEW

[논문 리뷰] MindGPT: Interpreting What You See with Non-invasive Brain Recordings

Jiaxuan Chen, Qi Yu|arXiv (Cornell University)|2023. 09. 27.
Neural dynamics and brain functionNeuroscience인용 수 3
한 줄 요약

MindGPT는 비침습적인 신경 디코더로, 시각 자극의 자연어 기반 설명으로 fMRI 뇌 신호를 번역한다. 이는 시각-언어 대비 인코더와 교차 어텐션, GPT-2를 활용하여 종단 간 의미 정렬을 구현한다. 높은 시각皮질(HVC) 신호만으로도 높은 정밀도의 의미적 복원을 달성하여 HVC가 대부분의 의미 정보를 포함하고 있으며, 시각적 단서가 어텐션 기반의 주목 지도를 통해 복원을 이끈다는 것을 입증한다.

ABSTRACT

Decoding of seen visual contents with non-invasive brain recordings has important scientific and practical values. Efforts have been made to recover the seen images from brain signals. However, most existing approaches cannot faithfully reflect the visual contents due to insufficient image quality or semantic mismatches. Compared with reconstructing pixel-level visual images, speaking is a more efficient and effective way to explain visual information. Here we introduce a non-invasive neural decoder, termed as MindGPT, which interprets perceived visual stimuli into natural languages from fMRI signals. Specifically, our model builds upon a visually guided neural encoder with a cross-attention mechanism, which permits us to guide latent neural representations towards a desired language semantic direction in an end-to-end manner by the collaborative use of the large language model GPT. By doing so, we found that the neural representations of the MindGPT are explainable, which can be used to evaluate the contributions of visual properties to language semantics. Our experiments show that the generated word sequences truthfully represented the visual information (with essential details) conveyed in the seen stimuli. The results also suggested that with respect to language decoding tasks, the higher visual cortex (HVC) is more semantically informative than the lower visual cortex (LVC), and using only the HVC can recover most of the semantic information. The code of the MindGPT model will be publicly available at https://github.com/JxuanC/MindGPT.

연구 동기 및 목표

  • fMRI를 사용하여 시각 인지 내용을 자연어로 번역하는 비침습적 뇌-컴퓨터 인터페이스를 개발한다.
  • 이미지 복원 방법의 한계를 해결한다. 이러한 방법들은 종종 흐릿하거나 의미적으로 일치하지 않는 출력을 생성한다.
  • 뇌 활동이 시각 자극에 대한 의미적으로 정확하고 문법적으로 올바른 언어 기반 설명을 생성하는 데 사용될 수 있는지 조사한다.
  • 시각적 주목과 주목도가 fMRI 신호에서 의미 복원을 이끄는 데 어떤 역할을 하는지 탐색한다.
  • 특히 시각 피질 내에서 의미 표현에 가장 기여하는 뇌 영역은 어디인지 규명한다.

제안 방법

  • 교차 어텐션 레이어를 갖춘 CLIP 유도 fMRI 인코더를 사용하여 뇌 활동 패tern을 공통 잠재 공간 내의 시각적 및 언어적 임bedding과 정렬한다.
  • 모델은 GPT-2를 텍스트 생성기로 활용하여 fMRI 인코딩된 표현에 조건화된 방식으로 유창하고 일관성 있는 언어 시퀀스를 생성한다.
  • 교차 어텐션 메커니즘을 통해 모델은 생성된 텍스트의 특정 의미 개념과 대응하는 관련 뇌 영역에 주목할 수 있다.
  • 모델는 fMRI 표현과 해당되는 CLIP 임bedded 이미지 패치, GPT-2로 생성된 캡션 간의 대비 학습을 통해 종단 간으로 훈련된다.
  • 시각적 주목도는 supervision 없이 fMRI 인코딩된 클래스 임베딩과 CLIP 패치 임베딩 간의 코사인 유사도를 통해 유도된다.
  • 모델 평가에는 인간이 애너테이션한 이미지 캡션을 사용하며, VQ-fMRI 및 MinD-Vis와 같은 시각 복원 베이스라인과 비교한다.

실험 결과

연구 질문

  • RQ1비침습적 기록 없이 fMRI 신호만으로도 시각 자극에 대한 정확하고 의미적으로 유의미한 자연어 기반 설명을 생성할 수 있는가?
  • RQ2저위 시각 피질(LVC)과 고위 시각 피질(HVC) 중 어느 영역이 언어 생성에서 의미 복원에 더 기여하는가?
  • RQ3fMRI-CLIP 유사도 지도를 통해 추론된 시각적 주목 메커니즘이 생성된 언어의 의미적 내용을 어느 정도 이끈다는가?
  • RQ4제한된 fMRI 훈련 데이터만으로도 명시적 주목 감독 없이 다양한 시각 자극에 대해 일반화할 수 있는가?
  • RQ5뇌 기반 표현은 다모달 의미 지ap과 어떻게 관련되어 있으며, 이를 통해 개념적 의미를 언어로 복원할 수 있는가?

주요 결과

  • MindGPT는 자극의 핵심 시각적 세부 정보를 정확히 반영하는 자연어 기반 설명을 성공적으로 생성하여, 의미 정밀도 측면에서 이미지 복원 기반선보다 뛰어나다.
  • 고위 시각 피질(HVC)만으로도 시각 자극의 대부분의 의미적 내용을 회복할 수 있는 충분한 신경 정보를 포함하고 있으며, 저위 시각 피질(LVC)보다 성능이 뛰어나다.
  • fMRI-CLIP 유사도에서 추론된 시각적 주목 지도는 '피아노', '기체', 또는 '모래해변'과 같은 디코딩된 언어 내용과 강한 일치를 보이며, 주목 기반 디코딩을 확인한다.
  • 색상 오류와 같은 디코딩 오류, 예를 들어 '흑백 사진'으로 잘못 기재된 경우, fMRI 표현 내에서 잘못된 주목 지점으로 기인함을 확인하여 주목도가 의미적 편향에 기여한다는 것을 입증한다.
  • MindGPT의 잠재 표현은 계층적 시각 처리에 대한 알려진 신경과학적 발견과 일치하는 국소성 민감성 특성을 보이며,
  • 제한된 훈련 데이터로도 임의의 작업에 관련된 시각적 단서를 포착하는 잠재적 능력을 보이며, 의미 표현의 강건한 일반화 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.