Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Language Models are not Born Equal to Fit Brain Data, but Training Helps

Alexandre Pasquiou, Yair Lakretz|arXiv (Cornell University)|2022. 07. 07.
Topic Modeling인용 수 8
한 줄 요약

이 연구는 청취 중인 오디오북 동안 뇌 활동을 예측하는 데 있어 신경어휘모델(NLM) 아키텍처, 훈련, 퍼플렉서티, 훈련 데이터의 영향을 조사한다. 연구 결과, 훈련되지 않은 LSTMs가 더 낮은 컨텍스트 민감도 덕분에 트랜스포머보다 뛰어난 성능을 보이며, 훈련은 모든 아키텍처에서 뇌 점수를 향상시키지만, 특히 트랜스포머에서 두드러진다. 또한 퍼플렉서티는 뇌 적합도를 예측하는 데 빈약한 지표이며, 제한된 데이터로 훈련된 오프더쇼프 모델은 뇌 활성화를 탐지할 통계적 능력이 부족하다.

ABSTRACT

Neural Language Models (NLMs) have made tremendous advances during the last years, achieving impressive performance on various linguistic tasks. Capitalizing on this, studies in neuroscience have started to use NLMs to study neural activity in the human brain during language processing. However, many questions remain unanswered regarding which factors determine the ability of a neural language model to capture brain activity (aka its 'brain score'). Here, we make first steps in this direction and examine the impact of test loss, training corpus and model architecture (comparing GloVe, LSTM, GPT-2 and BERT), on the prediction of functional Magnetic Resonance Imaging timecourses of participants listening to an audiobook. We find that (1) untrained versions of each model already explain significant amount of signal in the brain by capturing similarity in brain responses across identical words, with the untrained LSTM outperforming the transformerbased models, being less impacted by the effect of context; (2) that training NLP models improves brain scores in the same brain regions irrespective of the model's architecture; (3) that Perplexity (test loss) is not a good predictor of brain score; (4) that training data have a strong influence on the outcome and, notably, that off-the-shelf models may lack statistical power to detect brain activations. Overall, we outline the impact of modeltraining choices, and suggest good practices for future studies aiming at explaining the human language system using neural language models.

연구 동기 및 목표

  • 신경어휘모델(NLM)의 아키텍처, 훈련, 퍼플렉서티, 훈련 데이터 중 어떤 것이 자연어 처리 중 fMRI 타임커브를 예측하는 데 가장 큰 영향을 미치는지 조사하기.
  • 훈련되지 않은 모델이 의미 있는 뇌 신호를 이미 포착하고 있는지, 특히 반복되는 단어에 대한 반응 유사성 여부를 평가하기.
  • 퍼플렉서티(테스트 손실)가 모델의 뇌 활동 적합도 성공 여부를 신뢰할 수 있게 예측하는지 평가하기.
  • 예를 들어 위키백과 전용으로만 훈련된 오프더쇼프 모델이 뇌 활성화를 탐지할 수 있는 충분한 통계적 능력을 갖추고 있는지 확인하기.
  • 신경어휘모델(NLM)을 사용하여 신경영상 연구에서 인간의 언어 처리를 모델링하는 데 최선의 실천 방법을 규명하기.

제안 방법

  • 참가자들이 '작은 왕자' 오디오북을 청취하는 동안의 fMRI 데이터를 바탕으로 네 가지 NLM 아키텍처—GloVe, LSTM, GPT-2, BERT—를 훈련하고 평가했다.
  • 각 모델의 훈련되지 않은 버전(랜덤 또는 고정 임베딩)을 완전히 피니튜닝된 버전과 비교하여 훈련의 영향을 분리했다.
  • 뇌 점수를 뇌 영역 전역에서 모델 활성화와 fMRI 타임커브 간의 상관계수로 측정하였으며, 선형 모델을 사용해 신경 반응을 예측했다.
  • 모델 수렴 과정에서 퍼플렉서티와 뇌 점수를 훈련 에포크 동안 추적하여 그 관계를 평가했다.
  • 대규모 및 위키백과 전용 데이터셋을 포함한 다양한 훈련 코퍼스를 사용하여 데이터 영향을 모델 성능에 평가했다.
  • 모델과 훈련 조건 간의 통계적 비교를 수행하여, 훈련이 예측을 향상시키는 데 일관되게 영향을 주는 뇌 영역를 규명했다.

실험 결과

연구 질문

  • RQ1훈련되지 않은 신경어휘모델이 fMRI 뇌 활동에서 유의미한 분산을 설명할 수 있으며, 아키텍처에 따라 성능이 어떻게 달라지는가?
  • RQ2모델 아키텍처에 관계없이 훈련이 항상 뇌 활동 예측 능력을 향상시키는가?
  • RQ3다양한 아키텍처와 훈련 단계에서 퍼플렉서티가 뇌 점수를 신뢰할 수 있는 예측 지표로 작용하는가?
  • RQ4훈련 코퍼스의 크기와 유형이 뇌 데이터에 대한 모델의 적합 능력에 어떻게 영향을 미치는가, 특히 오프더쇼프 모델의 경우 어떻게 되는가?
  • RQ5어떤 뇌 영역에서 다양한 모델 유형과 훈련 조건에서 일관되게 예측 성능 향상이 관찰되는가?

주요 결과

  • 훈련되지 않은 LSTMs가 훈련되지 않은 트랜스포머와 GloVe보다 fMRI 반응을 더 잘 예측한다. 이는 낮은 컨텍스트 민감도와 더 안정적인 단어 표현 덕분일 것이다.
  • 훈련은 모든 모델 아키텍처에서 뇌 점수를 유의미하게 향상시키며, 동일한 뇌 영역 집합이 피니튜닝 후 일관되게 더 나은 예측 성능을 보였다.
  • 퍼플렉서티는 뇌 점수의 신뢰할 수 없는 예측 지표이다. 낮은 퍼플렉서티를 가진 모델이 반드시 더 높은 뇌 점수를 얻는 것은 아니다.
  • 위키백과 전용으로만 훈련된 오프더쇼프 모델는 뇌 활성화를 탐지할 수 있는 충분한 통계적 능력을 갖추지 못하며, 이는 훈련 데이터의 품질과 규모의 중요성을 강조한다.
  • 훈련으로 일관되게 향상되는 뇌 영역 네트워크는 핵심 언어 영역(IFS, STS)과 기본 동역량 네트워크(측두엽 각도, 덴트로메시얼 PFC)와 겹치며, 이는 맥락 기반 언어 처리에 관여할 수 있음을 시사한다.
  • 초기 성능이 낮았음에도 불구하고, 트랜스포머 기반 모델(GPT-2, BERT)은 LSTMs보다 훨씬 더 많은 이점을 얻어 훈련 후 뇌 점수 예측에서 승승을 거두었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.