Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal foundation models are better simulators of the human brain

Haoyu Lu, Qiongyi Zhou|arXiv (Cornell University)|2022. 08. 17.
Domain Adaptation and Few-Shot Learning인용 수 11
한 줄 요약

이 논문은 비브VL과 같은 다중모달 기초 모델이 단일모달 모델보다 인간 뇌를 더 우수한 시뮬레이터로 제공한다고 제안한다. 1,500만 개의 이미지-텍스트 쌍을 기반으로 대규모 다중모달 모델을 훈련하고 fMRI 데이터와 비교하여 표현을 평가함으로써, 다중모달로 훈련된 시각 및 언어 인코더가 다중감각 통합과 관련된 뇌 영역, 특히 복합성 측두피질과 후방 중간 측두회에서 신경 반응을 더 잘 예측함을 입증한다.

ABSTRACT

Multimodal learning, especially large-scale multimodal pre-training, has developed rapidly over the past few years and led to the greatest advances in artificial intelligence (AI). Despite its effectiveness, understanding the underlying mechanism of multimodal pre-training models still remains a grand challenge. Revealing the explainability of such models is likely to enable breakthroughs of novel learning paradigms in the AI field. To this end, given the multimodal nature of the human brain, we propose to explore the explainability of multimodal learning models with the aid of non-invasive brain imaging technologies such as functional magnetic resonance imaging (fMRI). Concretely, we first present a newly-designed multimodal foundation model pre-trained on 15 million image-text pairs, which has shown strong multimodal understanding and generalization abilities in a variety of cognitive downstream tasks. Further, from the perspective of neural encoding (based on our foundation model), we find that both visual and lingual encoders trained multimodally are more brain-like compared with unimodal ones. Particularly, we identify a number of brain regions where multimodally-trained encoders demonstrate better neural encoding performance. This is consistent with the findings in existing studies on exploring brain multi-sensory integration. Therefore, we believe that multimodal foundation models are more suitable tools for neuroscientists to study the multimodal signal processing mechanisms in the human brain. Our findings also demonstrate the potential of multimodal foundation models as ideal computational simulators to promote both AI-for-brain and brain-for-AI research.

연구 동기 및 목표

  • 다중모달 기초 모델이 단일모달 모델보다 인간 뇌 반응을 더 잘 시뮬레이션하는지 조사하는 것.
  • 인간 피실험자로부터의 fMRI 데이터와 비교하여 다중모달로 훈련된 인코더(시각적 및 언어적)의 신경 인코딩 성능을 평가하는 것.
  • 다중모달 사전훈련이 더 뇌 유사 표현을 만들어내는 특정 뇌 영역을 특정하는 것.
  • 다중모달 기초 모델이 뇌 기반 인공지능 및 신경과학 연구를 위한 효과적인 계산 시뮬레이터로 활용될 잠재력을 탐색하는 것.

제안 방법

  • 대규모 다중모달 기초 모델인 비브VL을 1,500만 개의 이미지-텍스트 쌍을 사용하여 대비 학습 방식으로 훈련시켰다.
  • 비브VL의 인코더에서 시각적 및 언어적 특징을 추출하고, 단일모달로 훈련된 모델(ViT 및 BERT)의 특징과 비교하였다.
  • banded ridge 회귀를 적용하여 fMRI 데이터의 신경 반응을 모델링하고, 모델 특징을 예측변수로 사용하였다.
  • 모델 특징이 볼륨 단위로 신경 반응의 분산을 얼마나 잘 설명하는지 정량화하기 위해 결정계수(R²)를 사용하였다.
  • R²를 분할하여 시각적 특징과 언어적 특징이 신경 인코딩 성능에 기여하는 고유 기여도를 분리해 분석하였다.
  • 다중감각 통합이 알려진 영역에 집중하여 여러 뇌 영역에서 인코딩 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1다중모달 기초 모델이 단일모달 모델보다 인간 뇌 활동을 더 잘 예측하는 표현을 생성하는가?
  • RQ2다중모달로 훈련된 인코더를 사용할 때 신경 인코딩 성능이 뚜렷이 향상되는 뇌 영역는 어디인가?
  • RQ3다중모달 모델과 단일모달 모델 간에 시각적 및 언어적 특징이 신경 인코딩에 기여하는 방식은 어떻게 다른가?
  • RQ4다중모달 표현이 인간 뇌의 다중감각 통합에 알려진 패턴과 어느 정도 일치하는가?
  • RQ5다중모달 기초 모델은 인공지능 및 신경과학 연구를 위한 효과적인 계산 시뮬레이터로 활용될 수 있는가?

주요 결과

  • 비브VL에서 다중모달로 훈련된 시각적 및 언어적 인코더는 단일모달로 훈련된 ViT 및 BERT보다 fMRI 반응 예측에서 유의미하게 높은 R² 값을 기록하였다.
  • 비브VL의 시각 인코더는 복합성 측두피질과 후방 중간 측두회에서 뛰어난 신경 인코딩 성능을 보였으며, 이는 다중감각 통합과 관련된 영역이다.
  • 비브VL의 언어 인코더는 의미 처리와 관련된 왼쪽 후방 중간 측두회에서 더 강력한 인코딩 성능을 보였다.
  • 여러 뇌 영역에서 비브VL의 시각적 및 언어적 특징의 조합 기여도가 단일모달 모델보다 더 많은 고유 분산을 설명하였다.
  • banded ridge 회귀 분석을 통해 다중모달 사전훈련이 모델 특징의 표현 정렬을 인간의 신경 반응과 더 잘 일치시키는 데 기여하는 것으로 나타났다.
  • 이 연구는 다중모달 기초 모델이 특히 교차 모달 통합에 관여하는 영역에서 더 뇌 유사 시뮬레이터임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.