[論文レビュー] Spikeformer: A Novel Architecture for Training High-Performance Low-Latency Spiking Neural Network
本稿では、最小限のシミュレーション時間ステップで、ニューロモーフィック(DVS-Gesture、DVS-CIFAR10)および静的(ImageNet)データセットの両方で最先端性能を達成する、新しいトランスフォーマーに基づくスパikingニューラルネットワーク(SNN)アーキテクチャ、Spikeformerを提案する。データハンガリーと訓練不安定性を解消するための畳み込みトーカナイザー(CT)モジュールを導入し、空間的および時間的依存関係を統合的にモデル化するためのスパatio-temporal attention(STA)を採用することで、SpikeformerはImageNetで2.2%、DVS-Gestureで3.1%高い性能を示し、低遅延かつ高精度なSNN訓練における優位性を示した。
Spiking neural networks (SNNs) have made great progress on both performance and efficiency over the last few years,but their unique working pattern makes it hard to train a high-performance low-latency SNN.Thus the development of SNNs still lags behind traditional artificial neural networks (ANNs).To compensate this gap,many extraordinary works have been proposed.Nevertheless,these works are mainly based on the same kind of network structure (i.e.CNN) and their performance is worse than their ANN counterparts,which limits the applications of SNNs.To this end,we propose a novel Transformer-based SNN,termed "Spikeformer",which outperforms its ANN counterpart on both static dataset and neuromorphic dataset and may be an alternative architecture to CNN for training high-performance SNNs.First,to deal with the problem of "data hungry" and the unstable training period exhibited in the vanilla model,we design the Convolutional Tokenizer (CT) module,which improves the accuracy of the original model on DVS-Gesture by more than 16%.Besides,in order to better incorporate the attention mechanism inside Transformer and the spatio-temporal information inherent to SNN,we adopt spatio-temporal attention (STA) instead of spatial-wise or temporal-wise attention.With our proposed method,we achieve competitive or state-of-the-art (SOTA) SNN performance on DVS-CIFAR10,DVS-Gesture,and ImageNet datasets with the least simulation time steps (i.e.low latency).Remarkably,our Spikeformer outperforms other SNNs on ImageNet by a large margin (i.e.more than 5%) and even outperforms its ANN counterpart by 3.1% and 2.2% on DVS-Gesture and ImageNet respectively,indicating that Spikeformer is a promising architecture for training large-scale SNNs and may be more suitable for SNNs compared to CNN.We believe that this work shall keep the development of SNNs in step with ANNs as much as possible.Code will be available.
研究の動機と目的
- 従来のサロゲート勾配法や変換手法で訓練されるスパikingニューラルネットワーク(SNN)の性能および遅延の制限を解消すること。
- SNNに適応された際のビジョントランスフォーマー(ViT)のデータハンガリーと訓練不安定性の問題を克服すること。
- CNNベースのSNNを上回り、ImageNetのような大規模データセットでANNの性能に並ぶかそれを上回る新しいSNNアーキテクチャを設計すること。
- 最小限のシミュレーション時間ステップで直接SNNを訓練可能にし、高い精度と低エネルギー消費を維持すること。
提案手法
- ViTの標準的なパッチ化スタムに代えて、SNNにおけるデータ効率性と訓練安定性を向上させるための畳み込みトーカナイザー(CT)モジュールを導入する。
- 空間的および時間的依存関係を統合的にモデル化するスパティオ・テンポラルアテンション(STA)機構を設計し、従来の方法が空間的または時間的アテンションのみを用いるのとは対照的に、スパikingシーケンス全体の相関を同時に捉える。
- 低遅延でエンドツーエンドにSNNを訓練するため、サロゲート勾配バックプロパゲーションを適用し、ANNからSNNへの変換の必要性を回避する。
- 安定した訓練を可能にしつつ効率性を維持するため、アーキテクチャ設計に「200トークン」ルールを採用する。
- アブレーションスタディを通じて、ネットワークの深さと時間ステップの最適化を実施し、さまざまな設定においても堅牢であることを示した。
- 初期設計段階で、トランスフォーマーブロックとCTモジュールの影響を優先するために、軽量で非残差構造を採用した。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマー基盤のSNNアーキテクチャは、低遅延でニューロモーフィックおよび静的画像データセットの両方で競争的または最先端の性能を達成できるか?
- RQ2SNNに適応された際のビジョントランスフォーマーのデータハンガリーと訓練不安定性の問題は、どのように緩和できるか?
- RQ3SNNにおける統合的空間的・時間的アテンションは、空間的または時間的のみのアテンションよりも優れた表現学習を実現するか?
- RQ4直接訓練されたSNNは、ImageNetのような大規模ベンチマークで、そのANN同等品を上回る性能を示せるか?
- RQ5安定的かつ高性能なSNN訓練に不可欠なアーキテクチャ設計原則(例:トークナイゼーション、シーケンス長)は何か?
主な発見
- Spikeformerは、わずか4時間ステップでDVS-Gestureで98.96%のトップ1精度を達成し、同等の遅延下で先行SOTA手法を1.04%上回った。
- DVS-CIFAR10では、4時間ステップで85.21%の精度を達成し、より少ない時間ステップとパラメータ数で、かつてのSOTAを16.6%も上回った。
- ImageNetでは、4時間ステップと38.75Mパラメータで78.31%のトップ1精度を達成し、サロゲート勾配法や変換手法で訓練されたSOTA SNNを5%以上上回った。
- Spikeformerは、ImageNetでANNの同等品を2.2%、DVS-Gestureで3.1%上回り、直接訓練されたSNNがこれらのベンチマークで初めてANN同等品を上回ったという画期的な成果を達成した。
- 畳み込みトーカナイザー(CT)モジュールは、バニラViTベースのSNNと比較して、DVS-Gestureの精度を16%以上向上させ、訓練の安定性を高め、収束を可能にした。
- アブレーションスタディにより、CTモジュールの重要性と、深さや時間ステップの異なる設定に対してもSpikeformerの堅牢性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。