Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Spiking Transformer

Ziqing Wang, Yuetong Fang|arXiv (Cornell University)|2022. 10. 03.
Advanced Memory and Neural Computing인용 수 5
한 줄 요약

이 논문은 이미지 분류에서 최고 성능을 달성하기 위해 ANN-to-SNN 변환을 활용하는 새로운 SNN 아키텍처인 마스킹 스파iking 트랜스포머(MST)를 제안한다. 랜덤 스파이크 마스킹(RSM)을 도입함으로써 추론 중 부작용 스파이크를 제거하여 75% 마스킹 비율에서 성능 손실 없이 전력 소비를 26.8% 감소시켰으며, 이는 높은 에너지 효율성과 모델의 강건성을 입증한다.

ABSTRACT

The combination of Spiking Neural Networks (SNNs) and Transformers has attracted significant attention due to their potential for high energy efficiency and high-performance nature. However, existing works on this topic typically rely on direct training, which can lead to suboptimal performance. To address this issue, we propose to leverage the benefits of the ANN-to-SNN conversion method to combine SNNs and Transformers, resulting in significantly improved performance over existing state-of-the-art SNN models. Furthermore, inspired by the quantal synaptic failures observed in the nervous system, which reduces the number of spikes transmitted across synapses, we introduce a novel Masked Spiking Transformer (MST) framework that incorporates a Random Spike Masking (RSM) method to prune redundant spikes and reduce energy consumption without sacrificing performance. Our experimental results demonstrate that the proposed MST model achieves a significant reduction of 26.8% in power consumption when the masking ratio is 75% while maintaining the same level of performance as the unmasked model.

연구 동기 및 목표

  • 이미지넷 분류와 같은 복잡한 비전 작업에서 SNN와 ANNs 간의 성능 격차를 해소하기 위해.
  • 특히 트랜스포머 기반 아키텍처에서 정확도를 훼손하지 않으면서 SNN의 전력 소비를 줄이기 위해.
  • ANN-to-SNN 변환 방법을 SNN 내 전면적인 자체주의 메커니즘에 적용할 수 있는지 탐색하기 위해.
  • 모델 성능을 유지하면서 불필요한 스파이크 전송을 줄이는 일반적인 스파이크 프루닝 방법을 개발하기 위해.

제안 방법

  • MST 프레임워크는 사전 훈련된 인공 트랜스포머를 스파이킹 버전으로 변환하기 위해 ANN-to-SNN 변환 방법을 사용하여 높은 정확도를 유지한다.
  • 추론 중 랜덤 스파이크 마스킹(RSM)을 적용하여 입력 스파이크의 일부를 무작위로 제거함으로써 스파이크 수와 에너지 소비를 줄인다.
  • RSM 방법은 트랜스포머 블록 내의 자체주의 및 MLP 모듈에 모두 적용되어 불필요한 스파이크 활동을 타겟으로 한다.
  • 훈련 안정성과 SNN와의 호환성을 향상시키기 위해, 트랜스포머 블록에서 배치 정규화(BN) 레이어가 레이어 정규화(LN) 레이어를 대체한다.
  • 에너지 절감과 성능 저하 간의 트레이드오프를 평가하기 위해 마스킹 비율을 다양하게 설정(0%, 50%, 75%)한다.
  • 스위트랜스포머, ResNet18, VGG16를 포함한 여러 아키텍처에서 평가하여 트랜스포머를 초월한 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1ANN-to-SNN 변환 방법이 트랜스포머 내 전면적인 자체주의 메커니즘에 효과적으로 적용되어 SNN에서 높은 성능을 달성할 수 있는가?
  • RQ2SNN에서 정확도 저하 없이 무작위 마스킹을 통해 얼마나 많은 불필요한 스파이크를 프루닝할 수 있는가?
  • RQ3랜덤 스파이크 마스킹(RSM) 방법이 다양한 SNN 아키텍처에서 전력 소비와 추론 성능에 어떤 영향을 미치는가?
  • RQ4RSM 방법은 트랜스포머를 초월해 ResNet 및 VGG와 같은 다른 딥 스파이킹 네트워크로 일반화될 수 있는가?
  • RQ5스파이킹 트랜스포머 모델에서 에너지 효율성과 모델 정확도를 균형 잡는 최적의 마스킹 비율은 무엇인가?

주요 결과

  • 마스킹 스파이킹 트랜스포머(MST)는 CIFAR-10, CIFAR-100, ImageNet에서 각각 이전 SOTA SNN 모델 대비 상위-1 정확도를 1.21%, 7.3%, 3.7% 향상시켰다.
  • 75% 마스킹 비율에서 MST 모델은 동일한 정확도를 유지하면서 전력 소비를 26.8% 감소시켰다.
  • RSM 방법은 MST 모델에서 스파이크 전송을 최대 74%까지 줄여, 성능 저하 없이 뚜렷한 에너지 절감 효과를 보였다.
  • ResNet18에서는 75% 마스킹 비율에서 전력 소비를 30.1% 감소시켰지만, 정확도가 3.6% 감소하여 고마스킹 수준에서 성능-에너지 트레이드오프가 존재함을 시사했다.
  • MST 모델의 어텐션 맵은 다양한 마스킹 비율에서도 객체 관련 영역에 일관되게 집중하는 것으로 나타나, 핵심 정보가 유지됨을 확인했다.
  • RSM 방법은 트랜스포머 외부의 비트랜스포머 SNN에도 효과적으로 일반화되어 ResNet18과 VGG16에서 중간에서 높은 에너지 절감 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.