Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-free Spikformer: Mixing Spike Sequences with Simple Linear Transforms

Qingyu Wang, Duzhen Zhang|arXiv (Cornell University)|2023. 08. 02.
Advanced Memory and Neural ComputingEngineering인용 수 3
한 줄 요약

이 논문은 스파iking 시퀀스 혼합을 위해 매개변수화된 스파이크 자체주의 모듈을 비매개변수화된 선형 변환—푸리에 변환과 웨이블릿 변환—으로 대체하는 Attention-free Spikformer를 제안한다. 학습 가능한 매개변수를 제거함에도 불구하고, 뉴로모픽 및 정적 데이터셋에서 SOTA 또는 유사한 정확도를 달성하며, 훈련 속도가 29–51% 빠르고, 추론 속도가 61–70% 빠르며, 메모리 사용량이 4–26% 적다.

ABSTRACT

By integrating the self-attention capability and the biological properties of Spiking Neural Networks (SNNs), Spikformer applies the flourishing Transformer architecture to SNNs design. It introduces a Spiking Self-Attention (SSA) module to mix sparse visual features using spike-form Query, Key, and Value, resulting in the State-Of-The-Art (SOTA) performance on numerous datasets compared to previous SNN-like frameworks. In this paper, we demonstrate that the Spikformer architecture can be accelerated by replacing the SSA with an unparameterized Linear Transform (LT) such as Fourier and Wavelet transforms. These transforms are utilized to mix spike sequences, reducing the quadratic time complexity to log-linear time complexity. They alternate between the frequency and time domains to extract sparse visual features, showcasing powerful performance and efficiency. We conduct extensive experiments on image classification using both neuromorphic and static datasets. The results indicate that compared to the SOTA Spikformer with SSA, Spikformer with LT achieves higher Top-1 accuracy on neuromorphic datasets (i.e., CIFAR10-DVS and DVS128 Gesture) and comparable Top-1 accuracy on static datasets (i.e., CIFAR-10 and CIFAR-100). Furthermore, Spikformer with LT achieves approximately 29-51% improvement in training speed, 61-70% improvement in inference speed, and reduces memory usage by 4-26% due to not requiring learnable parameters.

연구 동기 및 목표

  • Spikformer 내 복잡한 스파이크 자체주의 모듈을 대체하기 위해 더 단순하고 비매개변수화된 시퀀스 혼합 메커니즘이 가능한지 조사하는 것.
  • 스파이크 자체주의 이차 시간 복잡도($\mathcal{O}(N^2)$)를 로그선형($\mathcal{O}(N\log N)$)으로 감소시키면서 성능을 유지하거나 향상시키는 것.
  • 스파이크 시퀀스의 희박성과 특성을 고려해 고정 기저 기반 변환—푸리에 및 웨이블릿 변환—이 SNN 내에서 어떻게 기능하는지 평가하는 것.
  • 학습 가능한 매개변수에 의존하지 않고도 계산 효율성을 크게 향상시켜 뉴로모픽 하드웨어에 더 잘 적합한 모델을 구현하는 것.

제안 방법

  • Spikformer 내 스파이크 자체주의 모듈을 비매개변수화된 선형 변환, 특히 푸리에 변환(FT)과 웨이블릿 변환(WT)으로 대체하여 스파이크 시퀀스 혼합을 수행한다.
  • 1D 및 2D 버전의 FT와 WT를 사용해 시간 도메인 또는 주파수 도메인에서 스파이크 시퀀스를 처리함으로써 학습 가능한 가중치 없이도 효율적인 특징 혼합을 가능하게 한다.
  • 스파이크 형태의 Query, Key, Value 텐서에 변환을 적용하며, 그들 내부의 본질적 비음성 및 희박성을 활용해 소프트맥스 정규화를 피한다.
  • 선형 변환 모듈을 Spikformer 아키텍처에 SSA 레이어의 즉각적인 교체로 통합하여 동일한 모델 깊이와 너비를 유지한다.
  • 기본 기저 함수로 하르 웨이블릿과 표준 FFT 기저를 사용하며, 다른 웨이블릿 기저에 대한 분석 실험을 수행한다.
  • 동일한 초모수 조건 하에 뉴로모픽(CIFAR10-DVS, DVS128 Gesture) 및 정적(CIFAR-10, CIFAR-100) 데이터셋에서 최종 Spikformer 모델을 훈련 및 평가한다.

실험 결과

연구 질문

  • RQ1푸리에 및 웨이블릿 변환과 같은 비매개변수화된 선형 변환이 Spikformer 내 스파이크 시퀀스 혼합을 위해 매개변수화된 스파이크 자체주의 모듈을 효과적으로 대체할 수 있는가?
  • RQ2스파이크 자체주의 모듈을 선형 변환으로 대체함으로써 계산 복잡도를 감소시키면서도 뉴로모픽 및 정적 이미지 데이터셋에서 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ3희박하고 이진 스파이크 시퀀스의 맥락에서, 고정 기저 기반 변환은 적응형 어텐션 메커니즘보다 얼마나 뛰어나게 작용하는가?
  • RQ4다양한 웨이블릿 기저 함수는 성능에 어떤 영향을 미치며, 기저 선택이 분류 정확도에 상당한 영향을 미치는가?
  • RQ5스파이크 자체주의 모듈을 선형 변환으로 대체함으로써 얻는 훈련 및 추론 속도, 메모리 사용량, 매개변수 수의 실질적 성과는 어떠한가?

주요 결과

  • LT를 사용한 Spikformer는 CIFAR10-DVS에서 Top-1 정확도 81.6%를 달성하여 원본 Spikformer(80.9% 원본, 79.7% 재현)를 초월한다.
  • DVS128 Gesture에서 1D-FFT를 사용한 Spikformer가 SOTA Spikformer(80.9%)보다 0.8% 높은 정확도를 기록했으며, 부동소수점 스파이크를 사용한 TA-SNN을 능가한다.
  • 학습 가능한 매개변수가 없기 때문에 메모리 사용량이 4–26% 감소하였으며, CIFAR-10 및 CIFAR-100에서 모델 매개변수 수가 25% 감소하였다.
  • 푸리에 변환과 웨이블릿 변환의 로그선형 복잡도 덕분에 훈련 속도가 29–51% 향상되고, 추론 속도가 61–70% 향상되었다.
  • 하르 이외의 웨이블릿 기저 함수(예: Daubechies, Coiflet 등)도 CIFAR10-DVS 및 DVS128 Gesture에서 유사하거나 더 뛰어난 성능을 보였으며, 기저 선택에 대한 민감도가 낮음을 시사한다.
  • 뉴로모픽 데이터셋에서의 성능 향상은 고정 기저 기반 변환이 희박하고 이벤트 기반 스파이크 시퀀스에 대해 적응형 어텐션보다 더 적합하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.