Skip to main content
QUICK REVIEW

[論文レビュー] Spikformer: When Spiking Neural Network Meets Transformer

Zhaokun Zhou, Yuesheng Zhu|arXiv (Cornell University)|Sep 29, 2022
Advanced Memory and Neural Computing被引用数 103
ひとこと要約

この論文は Spiking Self Attention (SSA) と Spiking Transformer (Spikformer) を導入し、スパイクベースデータ上で直接動作させ、ImageNet 上で直接学習された SNN の中で最先端の結果を達成し、ニューロモルフィックデータセットでも競争力のある結果を示しつつ、エネルギー効率を保つ。

ABSTRACT

We consider two biologically plausible structures, the Spiking Neural Network (SNN) and the self-attention mechanism. The former offers an energy-efficient and event-driven paradigm for deep learning, while the latter has the ability to capture feature dependencies, enabling Transformer to achieve good performance. It is intuitively promising to explore the marriage between them. In this paper, we consider leveraging both self-attention capability and biological properties of SNNs, and propose a novel Spiking Self Attention (SSA) as well as a powerful framework, named Spiking Transformer (Spikformer). The SSA mechanism in Spikformer models the sparse visual feature by using spike-form Query, Key, and Value without softmax. Since its computation is sparse and avoids multiplication, SSA is efficient and has low computational energy consumption. It is shown that Spikformer with SSA can outperform the state-of-the-art SNNs-like frameworks in image classification on both neuromorphic and static datasets. Spikformer (66.3M parameters) with comparable size to SEW-ResNet-152 (60.2M,69.26%) can achieve 74.81% top1 accuracy on ImageNet using 4 time steps, which is the state-of-the-art in directly trained SNNs models.

研究の動機と目的

  • エネルギー効率とグローバル特徴のモデリングの両立を図るため、自己注意機構とスパイキングニューラルネットワーク(SNN)の統合を促進する。
  • 乗算と softmax を回避する、スパイクベースの計算に適合した自己注意の変種(SSA)を設計する。
  • SSA から構成される Spiking Transformer(Spikformer)を構築し、静的データとニューロモルフィックデータセットの両方で有効性を検証する。
  • 直接学習された Spikformer が ImageNet およびニューロモルフィックベンチマークで従来の SNN アーキテクチャを上回り、エネルギー効率も提供することを示す。

提案手法

  • softmax を用いず、スパイク形式の Query、Key、Value を用いて注意を計算する Spiking Self Attention (SSA) を提案する。
  • 学習可能な射影の後にスパイクニューロン層を通じて Q, K, V を計算し、0/1 の値を持つ系列を生成する。
  • ドット積計算を安定化させるスケーリング因子を適用し、スパイク演算(論理積と加算)で注意機構を実行する。
  • Spiking Patch Splitting (SPS) モジュールを用いてパッチを埋め込み、スパイクベースのブロックで生成されるスパイク形式の相対位置埋め込み(RPE)を追加する。
  • Spikformer エンコーダーブロック(SSA + 残差付き MLP)を積み重ね、分類のためにグローバル平均プーリングと線形ヘッドを用いる。
  • SNN 訓練に合致させるため層正規化の代わりにバッチ正規化を使用し、AdamW でゼロから学習する。

実験結果

リサーチクエスチョン

  • RQ1softmax と乗算を用いずに、SNN に自己注意を効果的に実装できるか?
  • RQ2スパイク形式の自己注意(SSA)が、静的データセットとニューロモルフィックデータセットの両方で、既存の SNN と比較して競争力のあるまたは優れた性能を実現するか?
  • RQ3ImageNet およびニューロモルフィックデータセットにおける Spikformer と最先端の直接学習済み SNN との精度とエネルギー効率のトレードオフは何か?

主な発見

  • SSA を用いた Spikformer は、静的データとニューロモルフィックデータの両方で、最先端の SNN 類似フレームワークを上回る。
  • ImageNet では、Spikformer-8-512 は 4 タイムステップで 73.38% の Top-1、Spikformer-8-768 は 74.81% の Top-1 に到達し、SEW-ResNet-152 を上回る。
  • Spikformer は CIFAR-10/100 およびニューロモルフィックデータセット(DVS128 Gesture および CIFAR10-DVS)で、はるかに小さいモデルとより低いエネルギー推定値で競争力のあるまたは優れた精度を示す。
  • SSA は softmax と乗算を回避し、スパイク形式の Q/K/V を用いた疎な計算で動作するため、理論的エネルギー消費(SOPs)を低く保ちつつ、精度を維持または向上させる。
  • 4 ブロックの SPS とスパイク形式の埋め込みにより効果的なパッチ処理を実現し、時間ステップやネットワークサイズの変化に対して堅牢な性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。