[논문 리뷰] Deep Residual Learning in Spiking Neural Networks
Spike-Element-Wise (SEW) ResNet을 도입하여 깊은 직접 학습 spiking 신경망을 가능하게 하고, degradation 및 기울기 소실/폭주를 극복하며 ImageNet, DVS Gesture, CIFAR10-DVS에서 직접 학습된 SNN 중 최첨단 성능을 달성한다.
Deep Spiking Neural Networks (SNNs) present optimization difficulties for gradient-based approaches due to discrete binary activation and complex spatial-temporal dynamics. Considering the huge success of ResNet in deep learning, it would be natural to train deep SNNs with residual learning. Previous Spiking ResNet mimics the standard residual block in ANNs and simply replaces ReLU activation layers with spiking neurons, which suffers the degradation problem and can hardly implement residual learning. In this paper, we propose the spike-element-wise (SEW) ResNet to realize residual learning in deep SNNs. We prove that the SEW ResNet can easily implement identity mapping and overcome the vanishing/exploding gradient problems of Spiking ResNet. We evaluate our SEW ResNet on ImageNet, DVS Gesture, and CIFAR10-DVS datasets, and show that SEW ResNet outperforms the state-of-the-art directly trained SNNs in both accuracy and time-steps. Moreover, SEW ResNet can achieve higher performance by simply adding more layers, providing a simple method to train deep SNNs. To our best knowledge, this is the first time that directly training deep SNNs with more than 100 layers becomes possible. Our codes are available at https://github.com/fangwei123456/Spike-Element-Wise-ResNet.
연구 동기 및 목표
- 깊고 효율적으로 학습 가능한 spiking neural networks (SNNs)이 얕은 구조를 넘어 필요하다는 점을 동기 부여한다.
- 기존 Spiking ResNet이 항등 매핑 구현과 안정적 기울기 달성에 대한 한계를 분석한다.
- SNN에서 진정한 잔여 학습을 가능하게 하는 Spike-Element-Wise (SEW) 잔여 블록을 제안한다.
- SEW ResNet이 100층 이상으로 확장 가능하고 여러 데이터셋에서 최첨단 직접 학습 SNN보다 성능이 우수함을 입증한다.
제안 방법
- 이산 시간 역학(Eqs. 1-3)과 역전파를 위한 대체 기울기(surrogate gradient)를 갖는 통합된 스파이킹 뉴런 모델을 정의한다.
- Spiking ResNet을 비판적으로 분석하고 항등 매핑을 쉽게 구현할 수 없고 기울기가 소실/폭주하는 문제(Eq. 8)가 발생함을 보인다.
- Spike Activation 이후에 잔여 부분과 입력을 원소별 함수 g(ADD, AND, IAND)로 결합하는 SEW 잔여 블록을 도입하여 항등 매핑을 쉽게 가능하게 한다(Eq. 9).
- SEW 블록이 일정하거나 제어된 기울기 전달을 보장함으로써 기울기 열퇴를 방지하는 방법(Eq. 11)을 설명한다.
- 깊이 전반에 걸쳐 기울기 흐름을 보존하기 위해 SN-활성화된 숏컷을 사용하는 다운샘플링 SEW 블록을 제공한다.
실험 결과
연구 질문
- RQ1직접 학습된 딥 SNN에서 ANN-에서 SNN으로의 변환에 의존하지 않고 잔여 학습을 효과적으로 구현할 수 있는가?
- RQ2SEW 잔여 블록이 매우 깊은 SNN에서도 안정적인 학습과 항등 매핑을 가능하게 하는가?
- RQ3ImageNet 및 뇌형뇌 데이터셋에서 SEW ResNet은 Spiking ResNet 및 기존 SNN 방법과 비교해 어떤 성능을 보이는가?
- RQ4다양한 원소별 함수 g(ADD, AND, IAND)가 학습 역학 및 성능에 미치는 영향은 무엇인가?
주요 결과
- SEW ResNet은 Spiking ResNet에서 관찰된 열화 문제를 극복하고 더 깊은 SEW 네트워크에서 정확도가 높아짐(예: ImageNet 결과).
- ImageNet에서 SEW ResNet-34/50/101/152은 정확도 면에서 Spiking ResNet 대비 우수하며, SEW ResNet-101/152는 직접 학습한 >100층의 최초 보고된 SNN이다.
- SEW 잔여 블록은 쉽게 항등 매핑과 안정적인 기울기 흐름을 가능하게 하고, 깊은 SEW 네트워크에서의 기울기 소실/폭주가 완화된 것으로 기울기 분석에서 나타난다.
- SEW ResNet은 DVS Gesture와 CIFAR10-DVS 같은 뇌형뇌 데이터셋에서 뛰어난 성능을 달성하고, ADD 기반 SEW 블록이 많은 경우에 최상의 정확도와 적은 시간단으로 가장 좋은 성능을 제공한다.
- 최신 직접 학습 SNN 및 ANN-to-SNN 변환과 비교할 때, SEW ResNet은 여러 벤치마크에서 낮은 잠복 바와 적은 파라미터로 경쟁력 있거나 우수한 정확도를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.