[論文レビュー] Efficient Deep Spiking Multi-Layer Perceptrons with Multiplication-Free Inference
本稿では、スパイクパッチ符号化とMFI互換性バッチ正規化を介して、局所的特徴抽出とグローバル受容 field を統合する、乗算を含まない深層スパイキングマルチレイヤーパーセプトロン(SNN-MLP)アーキテクチャを提案する。この手法は、計算量、パラメータ数、シミュレーションステップ数を削減しながら、ImageNet-1K で 66.39% のトップ-1精度を達成した。
Advancements in adapting deep convolution architectures for Spiking Neural Networks (SNNs) have significantly enhanced image classification performance and reduced computational burdens. However, the inability of Multiplication-Free Inference (MFI) to align with attention and transformer mechanisms, which are critical to superior performance on high-resolution vision tasks, imposing limitations on these gains. To address this, our research explores a new pathway, drawing inspiration from the progress made in Multi-Layer Perceptrons (MLPs). We propose an innovative spiking MLP architecture that uses batch normalization to retain MFI compatibility and introducing a spiking patch encoding layer to enhance local feature extraction capabilities. As a result, we establish an efficient multi-stage spiking MLP network that blends effectively global receptive fields with local feature extraction for comprehensive spike-based computation. Without relying on pre-training or sophisticated SNN training techniques, our network secures a top-1 accuracy of 66.39% on the ImageNet-1K dataset, surpassing the directly trained spiking ResNet-34 by 2.67%. Furthermore, we curtail computational costs, model parameters, and simulation steps. An expanded version of our network compares with the performance of the spiking VGG-16 network with a 71.64% top-1 accuracy, all while operating with a model capacity 2.1 times smaller. Our findings highlight the potential of our deep SNN architecture in effectively integrating global and local learning abilities. Interestingly, the trained receptive field in our network mirrors the activity patterns of cortical cells. Source codes are publicly accessible at https://github.com/EMI-Group/mixer-snn.
研究の動機と目的
- スパイキングニューラルネットワーク(SNNs)における、注意機構やトランスフォーマー機構と乗算を含まない推論(MFI)の不適合を克服すること。
- MFI互換性を維持しながら、効果的なグローバルおよびローカル特徴学習を可能にする、マルチレイヤーパーセプトロン(MLPs)に基づく深層SNNアーキテクチャを設計すること。
- 有向無閉路グラフ構造を用いたスパイクパッチ符号化層を導入することで、SNNにおけるローカル特徴抽出を強化すること。
- 事前学習や複雑な訓練技術に依存せずに、SNNベースの画像分類で最先端の性能を達成すること。
提案手法
- MLP-Mixerブロックにおける標準的な正規化をバッチ正規化(BN)に置き換えることで、乗算を含まない推論(MFI)との互換性を確保する。
- 初期層における局所的空間的特徴抽出を強化する目的で、有向無閉路グラフ(DAG)に基づくスパイクパッチ符号化モジュールを導入する。
- 計算コストを削減しながらもグローバル受容 field の能力を維持するため、トークン混合ブロックで軽量な軸方向サンプリングを採用する。
- スパイクベースの計算を完全に可能にするために、スキップ接続とMFIフレンドリーなコンponentsを用いてマルチステージのスパイキングMLPネットワークを構築する。
- ImageNet-1K でエンドツーエンドの学習を可能にするスパイクベースの訓練プロトコルを採用し、補間勾配バックプロパゲーションを用いる。
- 45nm CMOS技術を用いてエネルギー消費を推定し、加算演算あたり 0.9pJ、MAC 演算あたり 4.6pJ を割り当てる。
実験結果
リサーチクエスチョン
- RQ1乗算を含まない推論(MFI)と完全に互換性を持つ深層スパイキングMLPアーキテクチャを、画像分類タスクで高い性能を発揮するように設計できるか?
- RQ2MFI制約に反しない範囲で、スパイキングMLPにおけるローカル特徴抽出をどのように効果的に強化できるか?
- RQ3グローバルおよびローカル学習能力を備えたスパイキングMLPは、ImageNet-1K において、既存のスパイキング畳み込みネットワーク(例:ResNet-34)をどの程度上回れるか?
- RQ4提案されたSNNにおける学習済みの受容 field は、生物学的皮質細胞の「オフセンター・オンサロンド」構造に類似しているか?
- RQ5スパイクベースのMLPは、軽量かつエネルギー効率の良いコンponentとして、注意機構に基づくモデルに統合可能か?
主な発見
- 提案されたスパイキングMLP-SPE-Tは、ImageNet-1K で 66.39% のトップ-1精度を達成し、直接学習させたスパイキングResNet-34を 2.67% 上回った。
- スパイキングResNet-34と比較して、計算コストをほぼ半減させ、加算演算は 11.8億回、乗算演算は 1200万回にまで削減した。
- エネルギー消費は 1.12 mJ と推定され、モデル容量が同等の SparseMLP(13.75 mJ)や SpikFormer(11.58 mJ)よりも顕著に低かった。
- 初期層における学習済みの重みカーネルは、「M」字型の形状を示し、皮質細胞の「オフセンター・オンサロンド」構造に類似していた。
- ネットワークの拡張版は、スパイキングVGG-16 よりもモデル容量が 2.1 倍小さいにもかかわらず、ImageNet-1K で 71.64% のトップ-1精度を達成した。
- MFI互換性バッチ正規化が、事前学習や複雑なSNN特化技術に依存せずに、深層スパイキングMLPの有効な訓練を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。