Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end topographic networks as models of cortical map formation and human visual behaviour: moving beyond convolutions

Zejin Lu, Adrien Doerig|arXiv (Cornell University)|2023. 08. 18.
Visual perception and processing mechanisms인용 수 4
한 줄 요약

이 논문은 표준 컨볼루션을 공간적으로 구조화되고 정렬된 층으로 대체함으로써 영양성의 시각 피질의 정위조직을 모델링하는 새로운 딥러닝 아키텍처인 All-Topographic Neural Networks(All-TNNs)를 소개한다. 시각 입력에 대해 엔드 투 엔드로 훈련된 All-TNNs는 초기 레이어에서 부드러운 방향성 지apap과 피질 확대를 자가조직화하고 후기 레이어에서 카테고리 선택적 영역을 형성하며, 인간의 물체 인식에서의 공간적 편향을 예측하는 데서 표준 컨볼루션 네트워크보다 뚜렷하게 뛰어난 성능을 보인다.

ABSTRACT

Computational models are an essential tool for understanding the origin and functions of the topographic organisation of the primate visual system. Yet, vision is most commonly modelled by convolutional neural networks that ignore topography by learning identical features across space. Here, we overcome this limitation by developing All-Topographic Neural Networks (All-TNNs). Trained on visual input, several features of primate topography emerge in All-TNNs: smooth orientation maps and cortical magnification in their first layer, and category-selective areas in their final layer. In addition, we introduce a novel dataset of human spatial biases in object recognition, which enables us to directly link models to behaviour. We demonstrate that All-TNNs significantly better align with human behaviour than previous state-of-the-art convolutional models due to their topographic nature. All-TNNs thereby mark an important step forward in understanding the spatial organisation of the visual brain and how it mediates visual behaviour.

연구 동기 및 목표

  • 표준 컨볼루션 네트워크가 표현하지 못하는 영양성의 시각 피질의 공간적 정위조직을 반영하는 딥러닝 모델을 개발하는 것.
  • 신경망 아키텍처에 공간적 조직을 통합함으로써 촉각 지도 형성의 계산 모델과 인간의 시각 행동 사이의 격차를 메우는 것.
  • 모델-행동 일치를 직접 평가하기 위해 인간의 물체 인식에서의 공간적 편향에 관한 새로운 데이터셋을 구축하는 것.
  • 정위조직이 신경망에 통합될 경우 표준 컨볼루션 모델보다 인간의 시각 행동을 더 잘 예측할 수 있음을 보여주는 것.

제안 방법

  • 표준 컨볼루션 레이어를 정위조직 구조화된 공간 불변 특징 지도로 대체하여 촉각 지도 원칙을 반영하는 All-Topographic Neural Networks(All-TNNs)를 설계한다.
  • 자연 이미지 데이터셋에 대해 엔드 투 엔드로 All-TNNs를 훈련시켜 감독 없이도 정위조직 특징이 자가조직화되도록 한다.
  • 모델 성능을 인간 데이터와 비교하기 위해 물체 인식에서의 공간적 편향을 측정하는 새로운 인간 행동 데이터셋을 통합한다.
  • All-TNNs를 사용해 첫 번째 레이어에서 부드러운 방향성 지도와 피질 확대를 학습시키고, 더 깊은 레이어에서 카테고리 선택적 반응을 학습시킨다.
  • 기존의 망막 정위조직 및 정위조직 맵핑 원칙을 반영한 공간적으로 구조화된 가중치 초기화 및 연결 패턴을 사용한다.
  • All-TNNs를 최신 컨볼루션 신경망(CNNs)과 비교하여 정위조직 특징의 부상과 인간 행동 예측 능력에서 직접 평가한다.

실험 결과

연구 질문

  • RQ1정위조직이 구현된 딥 네트워크 아키텍처가 영양성의 시각 정위조직의 핵심 특징인 방향성 지도와 피질 확대와 같은 요소들을 자가조직화할 수 있는가?
  • RQ2컨벌루션을 정위조직 레이어로 대체함으로써 딥러닝 모델이 인간의 시각 행동과의 일치도를 향상시킬 수 있는가?
  • RQ3All-TNNs가 표준 CNNs보다 인간의 물체 인식에서의 공간적 편향을 어느 정도 더 잘 예측할 수 있는가?
  • RQ4신경망에서 정위조직이 구현될 경우 인간의 시각 피질에 유사한 카테고리 선택적 영역이 나타날 수 있는가?
  • RQ5인간 행동 데이터셋의 통합이 시각 영역의 촉각 지도 모델 평가에 어떻게 기여하는가?

주요 결과

  • All-TNNs는 첫 번째 레이어에서 부드러운 방향성 지도와 피질 확대를 성공적으로 자가조직화하여 영양성의 시각 피질의 핵심 특징을 반영한다.
  • All-TNNs는 더 깊은 레이어에서 카테고리 선택적 반응을 형성하여 인간의 외측 스타이프티카 피질과 유사한 功能적 시각 영역의 형성 가능성을 시사한다.
  • All-TNNs는 최신 컨볼루션 신경망(CNNs)보다 인간의 물체 인식에서의 공간적 편향과 뚜렷한 일치를 보인다.
  • 정위조직 아키텍처는 인간 행동 데이터를 더 정확하게 예측할 수 있게 해주며, 공간적 조직의 기능적 중요성을 입증한다.
  • 새로운 인간 행동 데이터셋은 물체 인식에서 체계적인 공간적 편향이 존재하며, 이는 정위조직 모델이 더 잘 포착할 수 있음을 드러낸다.
  • 결과는 정위조직이 생물학적으로 타당할 뿐 아니라 인간의 시각 인지 모델링에 기능적으로 유리한 특성을 지닌다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.