Skip to main content
QUICK REVIEW

[論文レビュー] Semantic vector space models predict neural responses to complex visual stimuli

Umut Güçlü, Marcel van Gerven|arXiv (Cornell University)|Oct 15, 2015
Neural dynamics and brain function参考文献 8被引用数 17
ひとこと要約

本研究では、語彙埋め込み(Word2Vec や GloVe など)を含む意味的ベクトル空間モデルが、人間の視覚皮質における複雑な視覚刺激に対する神経応答を正確に予測できることを示している。特に上位階層の視覚領域で顕著である。この結果は、大規模な言語データから得られる分散的・連続的意味表現が、低レベルの特徴モデルよりも fMRI 応答を予測する能力に優れており、言語的意味と視覚情報の神経コードの間に強い関連があることを示している。

ABSTRACT

Encoding models have as their objective to predict neural responses to naturalistic stimuli with the aim of elucidating how sensory information is represented in the brain. This prediction is achieved by representing the stimulus in terms of a suitable feature space and using this feature space to linearly predict observed neural responses. Here, we investigate to what extent semantic vector space models can be used to predict neural responses to complex visual stimuli. We show that these models provide good predictions of neural responses in downstream visual areas, improving significantly over a low-level control model based on Gabor wavelet pyramids. The outlined approach provides a new way to model and map high-level semantic representations across cortex.

研究の動機と目的

  • 意味的ベクトル空間モデルが自然主義的視覚刺激に対する神経応答を予測できるかどうかを調査すること。
  • 分散的・連続的語彙埋め込みが、人間の脳における神経表現をどの程度反映しているかを評価すること。
  • 語彙埋め込みの予測性能を、Gabor 波形パラメータ(GWP)などの低レベル視覚特徴モデルと比較すること。
  • 視覚処理階層に沿った意味的表現の皮質的分布をマップすること。
  • 語彙埋め込みが、脳活動からの高レベル意味的コンテンツのデコードに有効なツールであるかを検討すること。

提案手法

  • 自然主義的 fMRI データセットからの画像を、各刺激に対して最初に思い浮かべた語で手動でラベル付けした。
  • 事前学習済みの Word2Vec(300D、Google News)および GloVe(さまざまな次元、Wikipedia および Twitter データセット)を用いて語彙埋め込みを抽出した。
  • 各画像について、関連するラベルの埋め込みを特徴ベクトルとして用い、個々のボクセルにおける fMRI 応答の振幅を予測した。
  • 線形符号化モデルを用い、語彙埋め込みを入力特徴として、ボクセル応答を予測した。
  • 視覚領域(V1–V4、LO、および V1–LO の前方)における相関に基づく符号化精度を用いて、モデルの性能を評価した。
  • Gabor 波形パラメータ(GWP)に基づく低レベルの制御モデルと性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1Word2Vec や GloVe などの意味的ベクトル空間モデルは、人間の脳における複雑な視覚刺激に対する神経応答を予測できるか?
  • RQ2視覚処理階層の途中から高レベル視覚領域にかけて、語彙埋め込みの予測性能はどのように変化するか?
  • RQ3語彙埋め込みは、自然主義的画像に対する神経応答を予測するうえで、低レベル視覚特徴モデルを上回る性能を示すか?
  • RQ4意味的表現は、特に腹側側頭皮質でどの程度皮質表面に分散しているか?
  • RQ5語彙埋め込みは、脳内の高レベル意味的表現の代理として機能できるか?

主な発見

  • Word2Vec モデル(300D、Google News)が、側頭外側補体(LO)で最高の平均符号化性能(0.2672)を達成し、テストされたすべてのモデルを顕著に上回った。
  • 最高性能を示した W2V モデルの有意なボクセルの割合は、V3 で 3.4% から LO で 19.1% に増加し、上位視覚領域に強い意味的表現が存在することを示した。
  • W2V モデルは、高レベル視覚領域(V3A、V3B、LO、および V1–LO の前方)で Gabor 波形パラメータ(GWP)制御モデルを有意に上回り、すべての比較で p < 0.001 であった。
  • W2V モデルの有意なボクセルの 54.9% が V1–LO の前方に位置し、平均予測精度は 0.2657 であった。これは、前方側頭領域に顕著な意味的チューニングがあることを示唆している。
  • 全テストモデルの中で、Google News データセットからの 300D Word2Vec 埋め込みが最高の全体的な符号化性能を示し、神経予測に優れた堅牢性を確認した。
  • 本研究は、言語モデルから得られる連続的・分散的意味的ベクトル空間が、複雑な視覚刺激に対する神経応答を予測できることを初めて示した。言語的意味と人間脳における神経コードの間に強い関連があることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。