Skip to main content
QUICK REVIEW

[論文レビュー] Attention-free Spikformer: Mixing Spike Sequences with Simple Linear Transforms

Qingyu Wang, Duzhen Zhang|arXiv (Cornell University)|Aug 2, 2023
Advanced Memory and Neural ComputingEngineering被引用数 3
ひとこと要約

本論文は、パラメータ化されたスパイク自己注意(SSA)モジュールを、スパイク系列の混合に使用するパラメータなしの線形変換(フーリエ変換およびウェーブレット変換)に置き換える、注意機構を不要としたSpikformerを提案する。学習可能なパラメータを排除しても、神経モルフォロジックおよび静的データセットでSOTAまたは同等の精度を達成しており、学習が29–51%高速、推論が61–70%高速、メモリ使用量が4–26%低減されている。

ABSTRACT

By integrating the self-attention capability and the biological properties of Spiking Neural Networks (SNNs), Spikformer applies the flourishing Transformer architecture to SNNs design. It introduces a Spiking Self-Attention (SSA) module to mix sparse visual features using spike-form Query, Key, and Value, resulting in the State-Of-The-Art (SOTA) performance on numerous datasets compared to previous SNN-like frameworks. In this paper, we demonstrate that the Spikformer architecture can be accelerated by replacing the SSA with an unparameterized Linear Transform (LT) such as Fourier and Wavelet transforms. These transforms are utilized to mix spike sequences, reducing the quadratic time complexity to log-linear time complexity. They alternate between the frequency and time domains to extract sparse visual features, showcasing powerful performance and efficiency. We conduct extensive experiments on image classification using both neuromorphic and static datasets. The results indicate that compared to the SOTA Spikformer with SSA, Spikformer with LT achieves higher Top-1 accuracy on neuromorphic datasets (i.e., CIFAR10-DVS and DVS128 Gesture) and comparable Top-1 accuracy on static datasets (i.e., CIFAR-10 and CIFAR-100). Furthermore, Spikformer with LT achieves approximately 29-51% improvement in training speed, 61-70% improvement in inference speed, and reduces memory usage by 4-26% due to not requiring learnable parameters.

研究の動機と目的

  • Spikformerにおける複雑なスパイク自己注意(SSA)モジュールを、より単純でパラメータなしの系列混合機構で置き換えられるかどうかを調査すること。
  • SSAの2次時間計算量($\mathcal{O}(N^2)$)を対数線形($\mathcal{O}(N\log N)$)に低減させつつ、性能を維持または向上させること。
  • 固定基底変換(フーリエ変換およびウェーブレット変換)が、SNNにおけるスパースなスパイク系列に与える効果を評価すること。
  • 学習可能なパラメータに依存せずに、計算効率を著しく向上させ、神経モルフォロジックハードウェアへの展開性を高めること。

提案手法

  • Spikformerのスパイク自己注意(SSA)モジュールを、パラメータなしの線形変換(特にフーリエ変換(FT)およびウェーブレット変換(WT))に置き換えることで、スパイク系列の混合を実現する。
  • 1次元および2次元のFTおよびWTを用い、時間領域または周波数領域でスパイク系列に作用させ、学習可能な重みを一切不要としない効率的な特徴混合を実現する。
  • スパイク形式のQuery、Key、Valueテンソルに変換を適用し、それらの固有の非負性およびスパarsityを活用して、ソフトマックス正規化を回避する。
  • 変換モジュールをSpikformerアーキテクチャにドロップインリプレースとして統合し、同じモデルの深さと幅を維持する。
  • 標準的なFFT基底およびハールウェーブレットをデフォルトの基底関数として使用し、代替のウェーブレット基底に関するアブレーションスタディを実施する。
  • 同一のハイパーパrameter設定下で、神経モルフォロジック(CIFAR10-DVS、DVS128 Gesture)および静的(CIFAR-10、CIFAR-100)データセットに対して、訓練および評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1フーリエ変換およびウェーブレット変換といったパラメータなしの線形変換が、Spikformerにおけるパラメータ化されたスパイク自己注意(SSA)モジュールの置き換えとして、スパイク系列の混合に効果的に機能するか。
  • RQ2SSAを線形変換に置き換えることで、神経モルフォロジックおよび静的画像データセットにおける計算複雑性を低減しつつ、モデルの精度を維持または向上させられるか。
  • RQ3スパースで2値のスパイク系列の文脈において、固定基底変換が、適応的アテンション機構を上回る程度の性能を示すか。
  • RQ4異なるウェーブレット基底関数が性能に与える影響はどの程度か。また、基底の選択が分類精度に顕著な影響を与えるか。
  • RQ5SSAを線形変換に置き換えることで、学習および推論速度、メモリ使用量、パラメータ数において、実用的な利点がどの程度得られるか。

主な発見

  • LT(線形変換)を用いたSpikformerは、CIFAR10-DVSでトップ1精度81.6%を達成し、元のSpikformer(SSA:80.9%(元の値)、79.7%(再現値))を上回った。
  • DVS128 Gestureでは、1D-FFTを用いたSpikformerがSOTAのSpikformer(SSA)を0.8%上回り、浮動小数点スパイクを用いたTA-SNNよりも優れた性能を示した。
  • 学習可能なパラメータが存在しないため、メモリ使用量が4–26%低減され、CIFAR-10およびCIFAR-100ではモデルパラメータが25%削減された。
  • FTおよびWTの対数線形複雑性のおかげで、学習速度が29–51%高速化され、推論速度が61–70%高速化された。
  • ハールを除く代替のウェーブレット基底関数も、CIFAR10-DVSおよびDVS128 Gestureで同等またはより優れた性能を示し、基底選択に対するロバストネスが示された。
  • 神経モルフォロジックデータセットにおける性能向上は、固定基底変換が、スパースでイベント駆動のスパイク系列に対して、適応的アテンションよりも適している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。