Skip to main content
QUICK REVIEW

[논문 리뷰] Accurate reconstruction of image stimuli from human fMRI based on the decoding model with capsule network architecture

Kai Qiao, Chi Zhang|arXiv (Cornell University)|2018. 01. 02.
EEG and Brain-Computer InterfacesNeuroscience참고 문헌 25인용 수 18
한 줄 요약

이 논문은 캡슐 네트워크(CapsNet) 아키텍처를 사용하여 인간 fMRI 데이터로부터 이미지 자극을 재구성하는 새로운 디코딩 모델인 CNAVR를 제안한다. 이는 특징 표현과 구조적 유사도를 향상시키기 위해 개발되었다. fMRI에서 고수준 캡슐 특징으로의 비선형 매핑과 그 반대로의 매핑을 엔드 투 엔드로 학습함으로써, 수기 숫자 재구성에서 기존 최고 수준의 방법들보다 SSIM이 10% 향상되었다.

ABSTRACT

In neuroscience, all kinds of computation models were designed to answer the open question of how sensory stimuli are encoded by neurons and conversely, how sensory stimuli can be decoded from neuronal activities. Especially, functional Magnetic Resonance Imaging (fMRI) studies have made many great achievements with the rapid development of the deep network computation. However, comparing with the goal of decoding orientation, position and object category from activities in visual cortex, accurate reconstruction of image stimuli from human fMRI is a still challenging work. In this paper, the capsule network (CapsNet) architecture based visual reconstruction (CNAVR) method is developed to reconstruct image stimuli. The capsule means containing a group of neurons to perform the better organization of feature structure and representation, inspired by the structure of cortical mini column including several hundred neurons in primates. The high-level capsule features in the CapsNet includes diverse features of image stimuli such as semantic class, orientation, location and so on. We used these features to bridge between human fMRI and image stimuli. We firstly employed the CapsNet to train the nonlinear mapping from image stimuli to high-level capsule features, and from high-level capsule features to image stimuli again in an end-to-end manner. After estimating the serviceability of each voxel by encoding performance to accomplish the selecting of voxels, we secondly trained the nonlinear mapping from dimension-decreasing fMRI data to high-level capsule features. Finally, we can predict the high-level capsule features with fMRI data, and reconstruct image stimuli with the CapsNet. We evaluated the proposed CNAVR method on the dataset of handwritten digital images, and exceeded about 10% than the accuracy of all existing state-of-the-art methods on the structural similarity index (SSIM).

연구 동기 및 목표

  • 딥 러닝의 발전에도 불구하고 인간 fMRI 데이터로부터 시각 자극을 정확하게 재구성하는 데 여전히 어려움이 존재하는 문제를 해결하기 위해.
  • 캡슐 네트워크를 활용하여 fMRI 디코딩에서 공간적 및 의미적 특징(예: 방향, 위치, 클래스)의 표현을 향상시키기 위해.
  • fMRI 활동에서 고수준 캡슐 특징으로의 매핑과 그 특징들로부터 이미지 재구성을 수행하는 엔드 투 엔드 학습 프레임워크를 개발하기 위해.
  • 재구성 정밀도 향상을 위해 그들의 인코딩 성능에 기반해 가장 정보가 많은 볼륨을 식별하고 활용하기 위해.
  • 시각 피부질에서 신경 활동과 인지적 이미지 재구성 사이의 격차를 계층적이고 주의 유사한 특징 조직 방식을 통해 메우기 위해.

제안 방법

  • 캡슐 네트워크 아키텍처를 사용하여 이미지 자극에서 고수준 캡슐 특징으로의 비선형 매핑을 학습하며, 이 특징들은 방향, 위치, 의미 클래스와 같은 다양한 특성을 인코딩한다.
  • 이중 단계 학습 과정을 적용한다: 먼저, 이미지에서 캡슐 특징으로의 매핑과 그 반대로의 매핑을 엔드 투 엔드 방식으로 학습한다.
  • 볼륨 선택은 각 볼륨의 인코딩 성능을 평가하여 수행되며, 정보가 많은 볼륨만 유지함으로써 차원을 축소하고 신호의 관련성을 향상시킨다.
  • 차원이 축소된 fMRI 데이터에서 고수준 캡슐 특징으로의 두 번째 비선형 매핑을 학습하여 뇌 활동으로부터 이러한 특징들을 예측할 수 있도록 한다.
  • 학습된 캡슐 네트워크를 사용하여 예측된 캡슐 특징을 다시 픽셀 수준의 이미지로 디코딩함으로써 이미지 재구성을 달성한다.
  • 모델 평가는 수기 숫자 이미지 데이터셋을 사용하며, 성능 측정은 구조적 유사도 지수(SSIM)를 통해 이루어진다.

실험 결과

연구 질문

  • RQ1기존의 딥 러닝 모델에 비해 캡슐 네트워크가 인간 fMRI 데이터로부터 이미지 재구성 정확도를 향상시킬 수 있는가?
  • RQ2캡슐 네트워크는 fMRI 디코딩에서 방향, 위치, 의미 클래스와 같은 계층적 시각적 특징을 얼마나 효과적으로 표현할 수 있는가?
  • RQ3캡슐 네트워크 기반 디코더의 엔드 투 엔드 학습이 기존의 오토인코더나 완전 연결 아키텍처에 비해 더 높은 재구성 정밀도를 제공하는가?
  • RQ4인코딩 성능에 기반한 볼륨 선택이 fMRI 디코딩에서 재구성 품질 향상에 얼마나 기여하는가?
  • RQ5캡슐 네트워크의 주의 유사 라우팅 메커니즘이 표준 풀링 또는 컨볼루션 레이어에 비해 재구성된 이미지의 공간 관계를 더 잘 포착할 수 있는가?

주요 결과

  • 제안된 CNAVR 방법은 fMRI 데이터로부터 수기 숫자 이미지를 재구성할 때, 기존 최고 수준의 방법들보다 구조적 유사도 지수(SSIM)가 10% 향상되었다.
  • 캡슐 네트워크가 공간 계층과 자세 관련 특징을 인코딩할 수 있는 능력이 재구성된 이미지의 품질을 크게 향상시켰다.
  • 인코딩 성능에 기반한 볼륨 선택은 잡음과 관련 없는 신호를 효과적으로 줄여 디코딩 과정의 강건성을 향상시켰다.
  • 캡슐 네트워크의 엔드 투 엔드 학습은 별도의 특징 추출 및 디코딩 단계를 가진 모델에 비해 더 나은 일반화 능력과 더 정확한 재구성을 가능하게 하였다.
  • 고수준 캡슐 특징은 자극의 의미적, 공간적, 구조적 특성을 성공적으로 포착하여 fMRI 패tern으로부터 충실도 높은 이미지 재구성을 가능하게 하였다.
  • 이 방법은 세밀한 시각적 세부 사항과 객체 구조를 재구성하는 데 뛰어난 성능을 보였으며, 이는 뇌 디코딩에서 캡슐 기반 표현의 효과성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.