[論文レビュー] V1T: large-scale mouse V1 response prediction using a Vision Transformer
この論文では、自然な視覚刺激に対するマウス一次視覚皮質(V1)の神経応答を、最先端の性能で予測するVision TransformerベースのモデルV1Tを紹介する。自己注意メカニズムを活用して、複数の動物に共通する視覚的および行動的表現を学習することで、従来の畳み込みニューラルネットワーク(CNN)モデルよりも12.7%の性能向上を達成し、受容野や瞳孔中心、走行速度といった行動変数との注意マップ相関を通じて生物学的に意味のある特徴を明らかにした。
Accurate predictive models of the visual cortex neural response to natural visual stimuli remain a challenge in computational neuroscience. In this work, we introduce V1T, a novel Vision Transformer based architecture that learns a shared visual and behavioral representation across animals. We evaluate our model on two large datasets recorded from mouse primary visual cortex and outperform previous convolution-based models by more than 12.7% in prediction performance. Moreover, we show that the self-attention weights learned by the Transformer correlate with the population receptive fields. Our model thus sets a new benchmark for neural response prediction and can be used jointly with behavioral and neural recordings to reveal meaningful characteristic features of the visual cortex.
研究の動機と目的
- 大規模な神経記録データを用いて、マウスV1神経応答をスケーラブルかつデータ駆動型に予測するモデルを開発すること。
- Vision Transformer(ViT)が、マウスV1応答のモデリングにおいて、畳み込みニューラルネットワーク(CNN)を上回るかを評価すること。
- ViTの自己注意メカニズムが、受容野や行動調節といった生物学的特性を反映しているかを調査すること。
- 走行速度、瞳孔拡張、瞳孔中心といった行動変数を予測フレームワークに統合し、応答モデリングの精度を向上させること。
- 注意可視化とアブレーションスタディーを用いて、視覚的計算の機能的組織を解明する新しいインシリコフレームワークを提供すること。
提案手法
- 共有コア表現モジュールとしてVision Transformer(ViT)を用い、コアリーディングアーキテクチャ内の従来のCNNを置き換える。
- モデルは動画刺激をパッチ埋め込み処理し、マルチヘッド自己注意メカニズムによってグローバルな依存関係を学習する。
- 走行速度、瞳孔拡張、瞳孔中心、およびその微分値といった行動変数が、学習可能なB-MLPモジュールを介して潜在埋め込みに統合される。
- 線形リーディングヘッドが、各動物の個々のニューロン応答に共有されたViT特徴をマップし、エンドツーエンドの学習を可能にする。
- 相関ベースの損失関数を用いて、数千のニューロンを含む2つの大規模なマウスV1データセットでモデルを学習する。
- モデルの挙動を解釈し、特定の行動変数の影響を評価するために、注意可視化とアブレーションスタディーが用いられる。

実験結果
リサーチクエスチョン
- RQ1Vision Transformerベースのアーキテクチャは、自然な視覚刺激に対するマウスV1神経応答を予測する際、畳み込みニューラルネットワーク(CNN)を上回ることができるか?
- RQ2ViTモデルの自己注意重みは、集団的受容野やリノトピーといった既知の生物学的特徴と相関しているか?
- RQ3走行速度や瞳孔ダイナミクスといった行動変数は、神経応答モデルの予測性能をどの程度向上させることができるか?
- RQ4訓練データ量の増加に伴い、ViTモデルの性能はCNNベースのモデルと比較してどの程度スケーリングするか?
- RQ5ViTモデルの注意機構は、注意誘導や空間選択性といったマウスV1の機能的組織に関するインサイトを明らかにできるか?
主な発見
- V1Tは、2つのホールドアウトテストセットでそれぞれ0.428および0.444のシングルトライアル相関を達成し、従来の畳み込みベースのモデルよりも12.7%以上の性能向上を示した。
- モデルの自己注意マップは、動物の瞳孔中心と顕著な相関を示しており、注意ヘッドがリノトピックな組織と固定視関連処理を反映していることを示している。
- V1Tは優れたデータ効率性を示し、データ量の増加に伴い性能が継続的に向上し、高データ環境下でもCNNを上回った。
- マウスV1予測のリーダーボードで2位の成績を収め、時間的応答トレンドを活用しないすべてのモデルを上回った。
- 走行速度や瞳孔拡張といった行動変数の統合により、予測精度が向上し、それらがV1応答に調節的役割を果たしていることを確認した。
- B-MLPモジュールは、スカラーベースの行動信号をViTの潜在空間に効果的に統合可能であり、アーキテクチャの大規模な再設計なしにマルチモーダル入力統合を支援した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。