Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end topographic networks as models of cortical map formation and human visual behaviour: moving beyond convolutions

Zejin Lu, Adrien Doerig|arXiv (Cornell University)|Aug 18, 2023
Visual perception and processing mechanisms被引用数 4
ひとこと要約

この論文は、標準的な畳み込みを空間的に構造化された、トポグラフィーに配列された層に置き換えることで、霊長目視覚皮質のトポグラフィー的組織をモデル化する、新しい深層学習アーキテクチャであるAll-Topographic Neural Networks (All-TNNs)を紹介する。視覚入力に対してエンド・トゥ・エンドで訓練されたAll-TNNsは、初期層で滑らかな方向性マップと皮質拡大を自己組織化し、後続の層でカテゴリー選択的領域を形成するが、人間の物体認識における空間的バイアスを予測する点で、畳み込みニューラルネットワーク(CNNs)を顕著に上回る性能を示す。

ABSTRACT

Computational models are an essential tool for understanding the origin and functions of the topographic organisation of the primate visual system. Yet, vision is most commonly modelled by convolutional neural networks that ignore topography by learning identical features across space. Here, we overcome this limitation by developing All-Topographic Neural Networks (All-TNNs). Trained on visual input, several features of primate topography emerge in All-TNNs: smooth orientation maps and cortical magnification in their first layer, and category-selective areas in their final layer. In addition, we introduce a novel dataset of human spatial biases in object recognition, which enables us to directly link models to behaviour. We demonstrate that All-TNNs significantly better align with human behaviour than previous state-of-the-art convolutional models due to their topographic nature. All-TNNs thereby mark an important step forward in understanding the spatial organisation of the visual brain and how it mediates visual behaviour.

研究の動機と目的

  • 標準的な畳み込みニューラルネットワークが表現できない、霊長目視覚皮質の空間的トポグラフィーを捉える深層学習モデルの開発。
  • 神経ネットワークアーキテクチャに空間的組織を組み込むことで、皮質マップ形成の計算モデルと人間の視覚行動のギャップを埋める。
  • モデルと行動の整合性を直接評価できるように、人間の物体認識における空間的バイアスの新しいデータセットを構築する。
  • トポグラフィックな組織が、標準的な畳み込みモデルと比較して、人間の視覚行動の予測をどのように改善するかを実証する。

提案手法

  • 標準的な畳み込み層を、トポグラフィックに構造化され、空間的に不変な特徴マップを持つ、皮質マップの原則を反映した層に置き換えるAll-Topographic Neural Networks (All-TNNs)の設計。
  • 自然画像データセット上でAll-TNNsをエンド・トゥ・エンドで訓練し、教師なし条件下でトポグラフィック特徴の自己組織化を可能にする。
  • 人間の行動データを測定する新しい人間行動データセットを統合し、モデルの性能を人間のデータと比較して評価。
  • All-TNNsを、最初の層で滑らかな方向性マップと皮質拡大を学習し、より深い層でカテゴリー選択的反応を学習するように訓練。
  • 視覚皮質におけるレティノトピックおよびトポグラフィックマッピングの既知の原則を反映した、空間的に構造化された重み初期化と接続パターンを採用。
  • All-TNNsを、トポグラフィック特徴の出現と人間行動予測の両面で、最先端の畳み込みニューラルネットワーク(CNNs)と直接比較。

実験結果

リサーチクエスチョン

  • RQ1トポグラフィックな組織を持つ深層ニューラルネットワークアーキテクチャは、方向性マップや皮質拡大といった、霊長目視覚トポグラフィーの主要特徴を自己組織化できるか?
  • RQ2畳み込み層をトポグラフィック層に置き換えることで、深層学習モデルと人間の視覚行動の整合性が向上するか?
  • RQ3All-TNNsは、標準的なCNNsと比較して、人間の物体認識における空間的バイアスをどの程度正確に予測できるか?
  • RQ4ニューラルネットワークにおけるトポグラフィックな組織が、人間の視覚皮質の外側側頭皮質に類似した機能的視覚領域の出現を促進できるか?
  • RQ5人間行動データセットの統合は、視覚分野における皮質マップモデルの評価をどのように向上させるか?

主な発見

  • All-TNNsは、最初の層で滑らかな方向性マップと皮質拡大を成功裏に自己組織化し、霊長目視覚皮質の主要特徴を再現している。
  • All-TNNsは、より深い層でカテゴリー選択的反応を発現しており、人間の外側側頭皮質に類似した機能的視覚領域の出現を示唆している。
  • All-TNNsは、最先端の畳み込みニューラルネットワーク(CNNs)と比較して、人間の空間的バイアスにおける物体認識の整合性が顕著に高い。
  • トポグラフィックなアーキテクチャにより、モデルは人間の行動データをより正確に予測でき、空間的組織の機能的意義を示している。
  • 新規に構築された人間行動データセットは、物体認識における体系的な空間的バイアスを明らかにし、トポグラフィックモデルがそれをよりよく捉えていることを示している。
  • 結果から、トポグラフィックな組織は生物学的に妥当であるだけでなく、人間の視覚認識のモデル化において機能的に優位であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。