[論文レビュー] What Are Large Language Models Mapping to in the Brain? A Case Against Over-Reliance on Brain Scores
この論文は、時間的自己相関、文の長さ、語の位置といった単純な非言語的特徴—これらが、訓練されていないモデルおよび微調整済みのLLMが予測する神経活動の大部分の分散を説明できることを示唆することで、LLM-脳類似性の指標としての脳スコアの妥当性に疑問を呈する。連続した訓練・テスト分割と体系的な特徴の除去を用いて、著者らは、先行研究における高い脳スコアが主にこれらの自明な特徴に起因していることを示し、LLMと人間の脳が共通の計算的原理を共有しているという主張を揺るがす。
Given the remarkable capabilities of large language models (LLMs), there has been a growing interest in evaluating their similarity to the human brain. One approach towards quantifying this similarity is by measuring how well a model predicts neural signals, also called "brain score". Internal representations from LLMs achieve state-of-the-art brain scores, leading to speculation that they share computational principles with human language processing. This inference is only valid if the subset of neural activity predicted by LLMs reflects core elements of language processing. Here, we question this assumption by analyzing three neural datasets used in an impactful study on LLM-to-brain mappings, with a particular focus on an fMRI dataset where participants read short passages. We first find that when using shuffled train-test splits, as done in previous studies with these datasets, a trivial feature that encodes temporal autocorrelation not only outperforms LLMs but also accounts for the majority of neural variance that LLMs explain. We therefore use contiguous splits moving forward. Second, we explain the surprisingly high brain scores of untrained LLMs by showing they do not account for additional neural variance beyond two simple features: sentence length and sentence position. This undermines evidence used to claim that the transformer architecture biases computations to be more brain-like. Third, we find that brain scores of trained LLMs on this dataset can largely be explained by sentence length, position, and pronoun-dereferenced static word embeddings; a small, additional amount is explained by sense-specific embeddings and contextual representations of sentence structure. We conclude that over-reliance on brain scores can lead to over-interpretations of similarity between LLMs and brains, and emphasize the importance of deconstructing what LLMs are mapping to in neural signals.
研究の動機と目的
- LLMにおける高い脳スコアが、人間の脳との真正な言語的類似性を反映しているのか、それとも単純な非言語的特徴によって駆動されているのかを調査すること。
- シャッフルされた訓練・テスト分割が脳スコア評価において不適切であることを挑戦すること。これは、fMRIデータにおける時間的自己相関によって汚染される可能性がある。
- LLM表現が神経信号において実際に予測しているものを体系的に解体すること。これには、理論的に興味のない単純な特徴と比較する。
- 訓練されていないモデルおよび微調整済みのLLMが、言語的計算によるものではなく、基本的な構造的および位置的手がかりの符号化によって高い脳スコアを達成していることを示すこと。
- LLMに脳に似た計算を推論する前に、神経符号化性能をより厳密に解体することを提唱すること。
提案手法
- fMRIデータにおける時間的自己相関の汚染を排除するために、シャッフルされた分割ではなく連続した訓練・テスト分割を用いた。
- 文の長さ、語の位置、文の位置といった単純な特徴を導入し、神経活動の分散を説明する能力を評価した。
- banded回帰を用いて、LLM表現がこれらの単純な特徴に加えて、どれほど追加の分散を説明できるかを評価した。
- FDR補正を施した片側対応t検定を用いて、LLMの性能がベースライン特徴よりも有意に優れているかを評価した。
- Pereira(fMRI)、Fedorenko(ECoG)、Blank(fMRI)の3つのデータセットで、言語ネットワークボクセルに焦点を当てて、アブレーションスタディを実施した。
- R²を用いて脳スコアを測定し、層や被験者ごとにLLM表現と神経活動の間の相関を、ベースライン特徴と比較した。

実験結果
リサーチクエスチョン
- RQ1fMRI研究におけるシャッフルされた訓練・テスト分割は、時間的自己相関に起因する誤った相関をどれほど導入するか?
- RQ2文の長さや語の位置といった単純な非言語的特徴が、訓練されていないLLMおよび微調整済みLLMの高い脳スコアを説明できるか?
- RQ3Pereira fMRIデータセットにおけるGPT2-XLが説明する神経活動の分散のうち、文の位置や自己相関に起因する割合はどれほどか?
- RQ4連続した分割と適切な統計的補正を用いた場合、Blank fMRIデータセットにおけるGPT2-XLの脳スコアは偶然の水準を上回るか?
- RQ5LLMにおける文脈的表現と意味埋め込みは、静的特徴を考慮した後でも、神経予測性にどれほど追加の寄与を示すか?
主な発見
- Pereira fMRIデータセットにおけるシャッフルされた訓練・テスト分割は、GPT2-XLが説明する分散の56.8%を占める自明な特徴(時間的自己相関、OASM)に起因しており、OASMそのものが神経活動の分散の56.8%を説明している。
- 訓練されていないGPT2-XLの高い脳スコアは、文の長さと文の位置によってほぼ完全に説明され、そのアーキテクチャに追加の説明力は見られない。
- Fedorenko ECoGデータセットでは、語の位置(WP)がGPT2-XLが説明する神経活動分散の90.8%を占め、WPそのものがGPT2-XLが説明する分散の81.6%を説明している。
- Blank fMRIデータセットでは、連続した分割を用いた場合、GPT2-XLの性能は偶然の水準にとどまり、FDR補正後に有意な神経予測性は認められなかった(1317個のfROIのうち0個)。
- 文の長さ、文の位置、静的語の埋め込みを考慮した後でも、GPT2-XLにおける意味埋め込みと文脈的表現が神経活動の分散に説明できる追加のわずかな部分しか残っていない。
- 本研究は、単純で非言語的な特徴が信号を支配している場合、脳スコアの背後にある特徴を解体しないままに過剰に解釈することによるLLM-脳類似性の過剰解釈が生じる可能性があると結論づける。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。