[論文レビュー] Enhancing the Performance of Transformer-based Spiking Neural Networks by SNN-optimized Downsampling with Precise Gradient Backpropagation
本論文は、変換器ベースのスパイクニューラルネットワークにおける誤った勾配バックプロパゲーションの性能ボトルネックを克服するため、精度の高い勾配バックプロパゲーションを可能にするSNN最適化ダウンサンプリングモジュールであるConvBN-MaxPooling-LIF(CML)を提案する。CMLは、ImageNetで77.64%のトップ1精度、CIFAR10-DVSで81.4%の精度を達成し、SpikingformerよりImageNetで+1.79%、CIFAR100で+1.16%の性能向上を達成し、最先端の結果を実現した。
Deep spiking neural networks (SNNs) have drawn much attention in recent years because of their low power consumption, biological rationality and event-driven property. However, state-of-the-art deep SNNs (including Spikformer and Spikingformer) suffer from a critical challenge related to the imprecise gradient backpropagation. This problem arises from the improper design of downsampling modules in these networks, and greatly hampering the overall model performance. In this paper, we propose ConvBN-MaxPooling-LIF (CML), an SNN-optimized downsampling with precise gradient backpropagation. We prove that CML can effectively overcome the imprecision of gradient backpropagation from a theoretical perspective. In addition, we evaluate CML on ImageNet, CIFAR10, CIFAR100, CIFAR10-DVS, DVS128-Gesture datasets, and show state-of-the-art performance on all these datasets with significantly enhanced performances compared with Spikingformer. For instance, our model achieves 77.64 $\%$ on ImageNet, 96.04 $\%$ on CIFAR10, 81.4$\%$ on CIFAR10-DVS, with + 1.79$\%$ on ImageNet, +1.16$\%$ on CIFAR100 compared with Spikingformer.
研究の動機と目的
- 変換器ベースのスパイクニューラルネットワーク(SNN)における誤った勾配バックプロパゲーションという重要な問題に対処すること。この問題はモデル性能を制限している。
- SNNに特化して最適化されたダウンサンプリングモジュールを設計し、トレーニング中に正確な勾配伝播を可能にすること。
- 事前学習されたANNからの distillation に依存せずに、直接学習可能なSNN(特にSpikformerおよびSpikingformer)の性能を向上させること。
- 静的画像および神経生物学的イベントベースのデータを含む多様なデータセットにおいて、提案されたモジュールの有効性を検証すること。
提案手法
- 畳み込み、バッチ正規化、マックスプーリング、LIFスパイクニューロンを統合した新しいダウンサンプリングモジュールであるConvBN-MaxPooling-LIF(CML)を提案する。
- CMLを変換器ベースのSNNに統合し、従来のダウンサンプリング層に代えて使用することで、スパイクダイナミクスと勾配の整合性を保証する。
- 理論的分析により、CMLがスパイクニューロンの膜電位を通じて微分可能な活性化パスを維持することで、正確な勾配バックプロパゲーションを可能にすることを証明する。
- サロゲート勾配法を用いてSNNをエンドツーエンドで学習し、CMLがバックプロパゲーション中に安定的かつ正確な勾配信号を保証すること。
- SpikformerおよびSpikingformerモデルにCMLを適用し、元のモデルと同一のトレーニングプロトコルおよびハイパーパrameterを維持する。
実験結果
リサーチクエスチョン
- RQ1SNNに特化して設計されたダウンサンプリングモジュールが、勾配の正確性を向上させ、結果としてモデル性能を向上させることができるか?
- RQ2提案されたCMLモジュールが、Spikformer や Spikingformer のような既存の変換器ベースSNNに内在する勾配不正確性の問題を克服できるか?
- RQ3CMLは静的画像および神経生物学的イベントベースのデータセットの両方で、どの程度性能を向上させることができるか?
- RQ4CMLは、事前学習されたANNからの知識蒸留を必要とせずに、直接学習可能なSNNで最先端の結果を達成できるか?
主な発見
- ImageNetではCMLが77.64%のトップ1精度を達成し、Spikingformerより+1.79%の向上を示した。
- CIFAR100では、Spikingformer + CMLモデルが81.4%の精度を達成し、元のSpikingformerより+1.16%の向上を示した。
- CIFAR10-DVSでは、Spikingformer + CMLが16時間ステップで81.4%のトップ1精度に達し、直接学習可能なSNNにおける新記録を樹立した。
- DVS128-Gestureでは、Spikingformer + CMLが16時間ステップで98.6%のトップ1精度に達し、直接学習可能なSNNにおける新記録を樹立した。
- 複数のデータセットにわたり一貫した性能向上が確認され、CMLの異なるデータモダリティおよびネットワークアーキテクチャへの汎用性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。