Skip to main content
QUICK REVIEW

[논문 리뷰] Advancing Spiking Neural Networks towards Deep Residual Learning

Yifan Hu, Lei Deng|arXiv (Cornell University)|2021. 12. 15.
Advanced Memory and Neural Computing인용 수 15
한 줄 요약

이 논문은 막막 전위 기반의 단서 경로를 갖춘 새로운 스파iking 신경망 아키텍처인 MS-ResNet을 제안한다. 이는 CIFAR-10에서 최대 482층, ImageNet에서 104층의 매우 깊은 SNN을 퇴화 없이 훈련 가능하게 한다. 블록 동적 등장 이론을 통해 기울기 노름 등식을 달성함으로써, MS-ResNet은 직접 훈련된 SNN에서 최고 성능을 기록하며, 뉴런당 평균 1개의 스파이크만으로 ImageNet에서 76.02%의 정확도를 달성한다. 이는 높은 정확도와 에너지 효율성을 동시에 확보한 것이다.

ABSTRACT

Despite the rapid progress of neuromorphic computing, inadequate capacity and insufficient representation power of spiking neural networks (SNNs) severely restrict their application scope in practice. Residual learning and shortcuts have been evidenced as an important approach for training deep neural networks, but rarely did previous work assess their applicability to the characteristics of spike-based communication and spatiotemporal dynamics. In this paper, we first identify that this negligence leads to impeded information flow and the accompanying degradation problem in previous residual SNNs. To address this issue, we propose a novel SNN-oriented residual architecture termed MS-ResNet, which establishes membrane-based shortcut pathways, and further prove that the gradient norm equality can be achieved in MS-ResNet by introducing block dynamical isometry theory, which ensures the network can be well-behaved in a depth-insensitive way. Thus we are able to significantly extend the depth of directly trained SNNs, e.g., up to 482 layers on CIFAR-10 and 104 layers on ImageNet, without observing any slight degradation problem. To validate the effectiveness of MS-ResNet, experiments on both frame-based and neuromorphic datasets are conducted. MS-ResNet104 achieves a superior result of 76.02% accuracy on ImageNet, which is the highest to our best knowledge in the domain of directly trained SNNs. Great energy efficiency is also observed, with an average of only one spike per neuron needed to classify an input sample. We believe our powerful and scalable models will provide a strong support for further exploration of SNNs.

연구 동기 및 목표

  • 기존 잔차 SNN에서 정보 흐름이 열악하여 발생하는 깊은 스파킹 신경망(SNN)의 퇴화 문제를 해결하기 위함.
  • 기존의 인공신경망(ANN)에서 변환하는 데 의존하는 방법의 한계를 극복하고, 백프로파게이션을 통한 시간 기반(BPTT)으로 직접 매우 깊은 SNN을 훈련할 수 있도록 하기 위함.
  • 블록 동적 등장 이론을 활용해 SNN의 기울기 안정성에 대한 이론적 기반을 확립하고, 깊이에 영향을 받지 않는 훈련 행동을 보장하기 위함.
  • CIFAR-10 및 ImageNet과 같은 표준 벤치마크에서 직접 훈련된 SNN의 최고 성능과 에너지 효율성을 달성하기 위함.
  • 프레임 기반 및 뉴모르픽 데이터셋 모두에서 제안된 아키텍처의 유효성을 검증하고, 실시간 시공간 데이터 처리 능력을 입증하기 위함.

제안 방법

  • 스파이크 활성화 함수의 연속적 리프레젠테이션을 사용하여, 시간 기반 백프로파게이션(BPTT)을 통한 엔드 투 엔드 훈련을 가능하게 하는, 막막 전위 기반의 단서 연결을 갖춘 새로운 SNN 아키텍처인 MS-ResNet을 제안한다. 이는 컨볼루션 레이어를 건너뛰며 직접 기울기 흐름을 가능하게 한다.
  • MS-ResNet에서 기울기 노름 등식이 달성될 수 있음을 증명하기 위해 블록 동적 등장 이론을 도입한다. 이는 깊이에 관계없이 안정적인 훈련을 보장한다.
  • 두 단계 훈련 전략을 적용한다: 첫 번째 단계로 T=1 타임스텝(뉴런당 한 번의 스파이크)에서의 프리트레이닝을 통해 가중치를 효율적으로 초기화하고, 두 번째 단계로 T=6 타임스텝에서의 파인튜닝을 통해 시공간 동역학을 학습한다.
  • 과적합을 억제하기 위해 동기화 배치 정규화와 고급 정규화 기법(라벨 스무딩, 드롭아웃, AutoAugment)을 사용한다.
  • 표준 스트라이드 컨볼루션을 대체하기 위해, 각 단서 연결 전에 스트라이드 2인 2x2 평균 풀링 레이어를 적용하여 다운샘플링 중 정보 손실을 방지한다.
  • 스파이크 활성화 함수의 연속적 리프레젠테이션을 사용한 서로우 프로세스 기반의 백프로파게이션을 통한 시간 기반(BPTT)을 적용하여 엔드 투 엔드 훈련을 수행한다.

실험 결과

연구 질문

  • RQ1스파이킹 신경망(SNN)의 고유한 시공간 동역학과 비미분 가능한 스파이크 행동을 감안할 때, 잔차 학습이 효과적으로 적용될 수 있는가?
  • RQ2기존 잔차 SNN이 왜 퇴화와 정보 흐름 저하를 겪는지, 이는 이론적이고 기하학적으로 어떻게 해결할 수 있는가?
  • RQ3기울기 노름 등식을 통해 SNN에서 깊이에 영향을 받지 않는 훈련 제도를 달성할 수 있으며, 이를 뒷받침하는 이론적 프레임워크는 무엇인가?
  • RQ4어떤 훈련 전략이 ANN 프리트레이닝이나 고타임스텝 추론에 의존하지 않고도 매우 깊은 SNN(예: 104층)을 효율적이고 안정적으로 훈련시킬 수 있는가?
  • RQ5직접 훈련된 SNN이 ImageNet과 CIFAR-10에서 변환된 또는 浅층 SNN에 비해 얼마나 높은 정확도와 에너지 효율성을 달성할 수 있는가?

주요 결과

  • MS-ResNet는 104층 아키텍처로 ImageNet에서 76.02%의 최고 성능 테스트 정확도를 기록했으며, 직접 훈련된 SNN 중에서 보고된 바 가장 높은 성능이다.
  • CIFAR-10에서 482층까지도 퇴화 없이 성공적으로 훈련되었으며, 이는 놀라운 깊이 확장성(스케일러빌리티)을 보여준다.
  • 입력 이미지를 분류하는 데 평균 뉴런당 1.0개의 스파이크만 필요로 하여 높은 에너지 효율성을 입증한다.
  • 두 단계 훈련 전략(T=1 프리트레이닝 이후 T=6 파인튜닝)을 통해 ImageNet에서 74.21%의 상위-1 정확도를 달성했으며, 직접 T=6 훈련에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 파인튜닝 단계에서 AutoAugment, 라벨 스무딩, 드롭아웃을 적용함으로써 깊은 SNN에서의 과적합을 효과적으로 억제하고 일반화 능력을 향상시켰다.
  • 이론적 분석을 통해 MS-ResNet에서 블록 동적 등장 이론을 통해 기울기 노름 등식이 달성 가능하며, 이는 안정적이고 깊이에 영향을 받지 않는 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.