[논문 리뷰] Efficient Deep Spiking Multi-Layer Perceptrons with Multiplication-Free Inference
이 논문은 스파iking 패치 인코딩과 MFI 호환 배치 정규화를 통해 국소적 특징 추출과 전역 수용장역할을 통합한 곱셈이 없는 깊이 있는 스파이킹 다층 퍼셉트론(SNN-MLP) 아키텍처를 제안한다. 이 방법은 계산량, 파라미터 수, 시뮬레이션 단계를 줄이며 ImageNet-1K에서 66.39%의 top-1 정확도를 달성하여 스파이킹 ResNet-34보다 2.67% 높다.
Advancements in adapting deep convolution architectures for Spiking Neural Networks (SNNs) have significantly enhanced image classification performance and reduced computational burdens. However, the inability of Multiplication-Free Inference (MFI) to align with attention and transformer mechanisms, which are critical to superior performance on high-resolution vision tasks, imposing limitations on these gains. To address this, our research explores a new pathway, drawing inspiration from the progress made in Multi-Layer Perceptrons (MLPs). We propose an innovative spiking MLP architecture that uses batch normalization to retain MFI compatibility and introducing a spiking patch encoding layer to enhance local feature extraction capabilities. As a result, we establish an efficient multi-stage spiking MLP network that blends effectively global receptive fields with local feature extraction for comprehensive spike-based computation. Without relying on pre-training or sophisticated SNN training techniques, our network secures a top-1 accuracy of 66.39% on the ImageNet-1K dataset, surpassing the directly trained spiking ResNet-34 by 2.67%. Furthermore, we curtail computational costs, model parameters, and simulation steps. An expanded version of our network compares with the performance of the spiking VGG-16 network with a 71.64% top-1 accuracy, all while operating with a model capacity 2.1 times smaller. Our findings highlight the potential of our deep SNN architecture in effectively integrating global and local learning abilities. Interestingly, the trained receptive field in our network mirrors the activity patterns of cortical cells. Source codes are publicly accessible at https://github.com/EMI-Group/mixer-snn.
연구 동기 및 목표
- 스파이킹 신경망(SNNs)에서 곱셈이 없는 추론(MFI)과 주의 메커니즘 및 트랜스포머 기반 기법 간의 호환성 문제를 해결하기 위해.
- MFI 호환성을 유지하면서 효과적인 전역 및 국소적 특징 학습이 가능한 다층 퍼셉트론(MLPs) 기반의 깊이 있는 SNN 아키텍처를 설계하기 위해.
- 방향성 비순환 그래프(DAG) 구조를 사용한 스파이킹 패치 인코딩 레이어를 도입하여 SNN의 국소적 특징 추출을 향상시키기 위해.
- 사전 훈련이나 복잡한 훈련 기법에 의존하지 않고도 SNN 기반 이미지 분류에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- MLP-Mixer 블록에서 표준 정규화를 배치 정규화(BN)로 대체하여 곱셈이 없는 추론(MFI)과의 호환성을 확보한다.
- 초기 레이어에서 국소적 공간적 특징 추출을 향상시키기 위해 방향성 비순환 그래프(DAG) 기반의 스파이킹 패치 인코딩 모듈을 도입한다.
- 계산 비용을 줄이면서도 전역 수용장역할 기능을 유지하기 위해 토큰 믹싱 블록에서 경량 축합 샘플링을 활용한다.
- 스피크 기반 계산을 완전히 구현할 수 있도록 스킵 연결과 MFI 우호적인 구성 요소를 사용해 다단계 스파이킹 MLP 네트워크를 구축한다.
- ImageNet-1K에서 네트워크를 엔드 투 엔드로 훈련하기 위해 서로서티 기반 경사 하강법(backpropagation)을 사용하는 스파이크 기반 훈련 프로토콜을 적용한다.
- 45nm CMOS 기술을 사용해 에너지 소비를 추정하며, 덧셈 연산당 0.9pJ, MAC 연산당 4.6pJ를 할당한다.
실험 결과
연구 질문
- RQ1곱셈이 없는 추론(MFI)과 완전히 호환되면서도 높은 성능을 유지할 수 있는 깊이 있는 스파이킹 MLP 아키텍처를 설계할 수 있는가?
- RQ2MFI 제약을 위반하지 않으면서도 스파이킹 MLP에서 국소적 특징 추출을 효과적으로 향상시킬 수 있는가?
- RQ3전역 및 국소 학습 능력을 갖춘 스파이킹 MLP가 ImageNet-1K에서 기존의 스파이킹 컨볼루션 네트워크인 ResNet-34를 얼마나 뛰어나게 성능으로 압도할 수 있는가?
- RQ4제안된 SNN에서 학습된 수용장역할이 생물학적皮질 수용장역할, 예를 들어 'off-center on-surround' 패턴과 유사한가?
- RQ5스피크 기반 MLP가 주의 기반 모델에 통합되어 경량이고 에너지 효율적인 구성 요소로 활용될 수 있는가?
주요 결과
- 제안된 스파이킹 MLP-SPE-T는 ImageNet-1K에서 66.39%의 top-1 정확도를 달성하여 직접 훈련된 스파이킹 ResNet-34보다 2.67% 높다.
- 스파이킹 ResNet-34 대비 거의 반으로 계산 비용을 절감하여 총 11.8억 번의 덧셈과 1,200만 번의 곱셈만을 사용한다.
- 에너지 소비는 1.12mJ로 추정되며, 유사한 모델 용량을 가진 SparseMLP(13.75mJ)와 SpikFormer(11.58mJ)보다 크게 낮다.
- 초기 레이어에서 학습된 수용장역할은 피질 세포의 'off-center on-surround' 구조를 닮은 'M'자형 가중치 커널을 나타낸다.
- 확장된 네트워크 버전은 스파이킹 VGG-16보다 모델 용량이 2.1배 작지만 ImageNet-1K에서 71.64%의 top-1 정확도를 달성한다.
- MFI 호환 배치 정규화가 사전 훈련이나 복잡한 SNN 전용 기법에 의존하지 않고도 깊이 있는 스파이킹 MLP의 효과적인 훈련을 가능하게 한다는 점을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.