Skip to main content
QUICK REVIEW

[論文レビュー] MindGPT: Interpreting What You See with Non-invasive Brain Recordings

Jiaxuan Chen, Qi Yu|arXiv (Cornell University)|Sep 27, 2023
Neural dynamics and brain functionNeuroscience被引用数 3
ひとこと要約

MindGPT は、視覚言語対照符号化器とクロスアテンション、GPT-2 を活用して fMRI 脳信号を視覚刺激の自然言語記述に変換する非侵襲的神経デコーダーである。エンドツーエンドの意味的整合性を実現するため、高次視覚皮質(HVC)の信号のみを用いても、視覚的コンテンツの高精度な意味的再構成が可能であり、HVC が大部分の意味的情報を保持しており、視覚的ヒントがアテンション駆動の局在マップによってデコーディングをガイドしていることを示している。

ABSTRACT

Decoding of seen visual contents with non-invasive brain recordings has important scientific and practical values. Efforts have been made to recover the seen images from brain signals. However, most existing approaches cannot faithfully reflect the visual contents due to insufficient image quality or semantic mismatches. Compared with reconstructing pixel-level visual images, speaking is a more efficient and effective way to explain visual information. Here we introduce a non-invasive neural decoder, termed as MindGPT, which interprets perceived visual stimuli into natural languages from fMRI signals. Specifically, our model builds upon a visually guided neural encoder with a cross-attention mechanism, which permits us to guide latent neural representations towards a desired language semantic direction in an end-to-end manner by the collaborative use of the large language model GPT. By doing so, we found that the neural representations of the MindGPT are explainable, which can be used to evaluate the contributions of visual properties to language semantics. Our experiments show that the generated word sequences truthfully represented the visual information (with essential details) conveyed in the seen stimuli. The results also suggested that with respect to language decoding tasks, the higher visual cortex (HVC) is more semantically informative than the lower visual cortex (LVC), and using only the HVC can recover most of the semantic information. The code of the MindGPT model will be publicly available at https://github.com/JxuanC/MindGPT.

研究の動機と目的

  • fMRI を用いて視覚的認識を自然言語に変換する非侵襲的脳インターフェースの開発。
  • しばしばぼやけた出力や意味的不一致を生じる画像再構成手法の限界を克服すること。
  • 脳活動が視覚刺激の意味的に正確で文法的に整合性のある言語記述を生成できるかを調査すること。
  • 視覚的注意と局在性が fMRI 信号からの意味的デコーディングをどのようにガイドするかを検討すること。
  • 特に視覚皮質において、どの脳領域が言語デコーディングにおける意味的表現に最も寄与しているかを特定すること。

提案手法

  • クロスアテンション層を備えた CLIP に駆動された fMRI 符号化器を用い、脳活動パターンを視覚的・言語的埋め込みと共有潜在空間で整合させる。
  • モデルは GPT-2 をテキスト生成器として採用し、fMRI 符号化表現を条件として、滑らかで一貫性のある言語系列を生成する。
  • クロスアテンション機構により、生成されたテキスト内の特定の意味的概念に対応する関連する脳領域に注目できる。
  • fMRI 表現と対応する CLIP 埋め込み画像パッチおよび GPT-2 生成キャプションを対比学習によりエンドツーエンドで訓練する。
  • 視覚的局在性は、fMRI 符号化クラス埋め込みと CLIP パッチ埋め込み間のコサイン類似度から推定され、いかなる教師信号も不要。
  • モデルは人間がアノテートした画像キャプションを用いて評価され、VQ-fMRI や MinD-Vis といった画像再構成ベースラインと比較される。

実験結果

リサーチクエスチョン

  • RQ1侵襲的記録を伴わず、fMRI 信号のみで視覚刺激の正確で意味的に意味のある自然言語記述を生成できるか?
  • RQ2視覚皮質の下位(LVC)と高次(HVC)の領域のうち、どの領域が言語生成における意味的デコーディングに寄与しているか?
  • RQ3fMRI-CLIP 類似度マップから推定される視覚的注意メカニズムが、生成された言語の意味的内容をどの程度ガイドしているか?
  • RQ4限定的な fMRI 訓練データのみを用いても、明示的な注意の教師信号なしに、多様な視覚的刺激に一般化できるか?
  • RQ5脳由来の表現は、非模態的意味的マップとどのように関係しており、それらを用いて概念的意味を言語で再構成できるか?

主な発見

  • MindGPT は、視覚的刺激の本質的詳細を正確に反映する自然言語記述を生成でき、画像再構成ベースラインより意味的忠実度が優れている。
  • 高次視覚皮質(HVC)の信号のみで、視覚刺激の大部分の意味的コンテンツを回復でき、下位視覚皮質(LVC)を上回る性能を示した。
  • fMRI-CLIP 類似度から推定された視覚的局在性マップは、生成言語内容(例:「ピアノ」「飛行機」「ビーチ」)と強く整合しており、アテンション駆動のデコーディングを示している。
  • 誤り例(例:「白黒の写真」と誤って色を特定)は、fMRI 表現における誤った注意の局在化に起因しており、局在性が意味的バイアスに与える役割を確認した。
  • MindGPT の潜在表現は、階層的視覚処理に関する神経科学的知見と整合する局所性感受性の性質を示している。
  • 限定的な訓練データでも、タスクに必要な視覚的手がかりを捉える能力が顕在化しており、意味的表現の強力な一般化を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。