[논문 리뷰] A Dual-Stream Neural Network Explains the Functional Segregation of Dorsal and Ventral Visual Pathways in Human Brains
이 논문은 인간의 덩어리(어디)와 병변(무엇) 시각 경로를 모방하기 위해 별도의 망막 샘플링과 다른 학습 목표(공간주의와 물체 인식)를 사용하는 뇌에 영감을 받은 이중 스트림 신경망을 제안한다. 주의 기반 눈동자의 이동과 두 스트림 간의 순환적 상호작용을 활용함으로써 모델은 인간 뇌 반응과 뛰어난 功能적 일치를 달성하며, 功能적 분리가 주로 시각 입력의 차이가 아니라 다른 목표에 기인한다는 것을 입증한다.
The human visual system uses two parallel pathways for spatial processing and object recognition. In contrast, computer vision systems tend to use a single feedforward pathway, rendering them less robust, adaptive, or efficient than human vision. To bridge this gap, we developed a dual-stream vision model inspired by the human eyes and brain. At the input level, the model samples two complementary visual patterns to mimic how the human eyes use magnocellular and parvocellular retinal ganglion cells to separate retinal inputs to the brain. At the backend, the model processes the separate input patterns through two branches of convolutional neural networks (CNN) to mimic how the human brain uses the dorsal and ventral cortical pathways for parallel visual processing. The first branch (WhereCNN) samples a global view to learn spatial attention and control eye movements. The second branch (WhatCNN) samples a local view to represent the object around the fixation. Over time, the two branches interact recurrently to build a scene representation from moving fixations. We compared this model with the human brains processing the same movie and evaluated their functional alignment by linear transformation. The WhereCNN and WhatCNN branches were found to differentially match the dorsal and ventral pathways of the visual cortex, respectively, primarily due to their different learning objectives. These model-based results lead us to speculate that the distinct responses and representations of the ventral and dorsal streams are more influenced by their distinct goals in visual attention and object recognition than by their specific bias or selectivity in retinal inputs. This dual-stream model takes a further step in brain-inspired computer vision, enabling parallel neural networks to actively explore and understand the visual surroundings.
연구 동기 및 목표
- 뇌의 이중 스트림 시각 처리 아키텍처를 모델링하여 인간 시각과 컴퓨터 시각 사이의 격차를 좁히는 것.
- dorsal 및 ventral 시각 경로의 功能적 분리가 망막 입력의 차이가 아니라 다른 학습 목표에 기인하는지 조사하는 것.
- 활동적이고 주의 기반의 시각 탐색을 모방함으로써 컴퓨터 시각 시스템의 강건성과 적응성을 향상시키는 것.
- 주의 기반 눈동자 이동이 인간 시각 처리의 신경망 모델에서 인코딩 성능을 어떻게 향상시키는지 평가하는 것.
제안 방법
- 모델는 덩어리 스트림을 위한 넓은/粗모양의 망막 샘플링과 병변 스트림을 위한 좁은/세밀한 망막 샘플링을 사용하여, 망막세포 및 파라바이오셀룰러 경로를 모방한다.
- WhereCNN은 공간주의를 사용하여 전경을 예측하고 고정 위치를 안내하는 시각적 주의를 처리한다.
- WhatCNN은 고정점 주변의 국소 시각을 처리하여 시간이 지남에 따라 물체 표현과 장면 수준의 이해를 재구성한다.
- 두 스트림은 순차적 고정을 통해 순환적으로 상호작용하여 동적 장면 표현을 가능하게 한다.
- 선형 변환을 통해 인간 fMRI 데이터와의 기능적 일치를 평가하여 모델 예측과 덩어리 및 병변 시각 영역의 뇌 반응을 비교한다.
- 주의 및 이중 스트림 아키텍처의 영향을 분리하기 위해 단일 스트림 네트워크(예: AlexNet, ResNet)와 무작위 고정 기준선과의 성능을 비교한다.
실험 결과
연구 질문
- RQ1인간 시각 시스템의 功能적 분리는 망막 샘플링의 차이가 아니라 다른 학습 목표에 의해 주로 발생하는가?
- RQ2주의 기반 눈동자 이동은 모델이 인간 뇌 반응을 예측하는 데 얼마나 기여하는가?
- RQ3이중 스트림 아키텍처는 덩어리 및 병변 시각 피질 영역에서의 반응 예측에 단일 스트림 모델과 비교해 어떻게 성능을 내는가?
- RQ4스트림 간의 순환적 상호작용이 장면 표현 향상과 뇌와의 기능적 일치 향상에 기여하는가?
주요 결과
- WhereCNN과 WhatCNN은 각각 덩어리 및 병변 시각 경로와 다른 기능적 일치를 보였으며, 이는 주로 망막 샘플링의 차이가 아니라 다른 학습 목표에 기인하였다.
- 모델는 AlexNet과 같은 단일 스트림 네트워크보다 더 뛰어난 인코딩 성능을 달성했고, ResNet18 및 ResNet34와 유사한 성능을 보였다.
- 주의 기반 고정은 대부분의 시각 피질 영역에서 예측 정확도를 높였으며, 두 스트림 모두 따뜻한 색조의 볼륨에서 높은 인코딩 성능(Δr > 0)을 기록했다.
- 학습된 고정을 사용함으로써 무작위 고정보다 더 정확한 뇌 반응 예측이 가능했으며, 특히 덩어리 및 병변 스트림 영역에서 두드러졌다.
- 이중 스트림 모델는 고립된 단일 스트림 모델보다 우수한 성능을 보였으며, 이는 상호작용적이고 병렬적인 처리 방식이 인간 뇌와의 기능적 일치를 향상시킨다는 것을 시사한다.
- 결과는 인간 뇌의 덩어리-병변 기능적 분리가 감각적 입력 편향보다는 공간주의와 물체 인식이라는 다른 인지적 목표에 의해 더 강하게 영향을 받는다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.