Skip to main content
QUICK REVIEW

[論文レビュー] Learning Activation Functions for Sparse Neural Networks

Mohammad Loni, Aditya Mohan|arXiv (Cornell University)|May 18, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、スパースニューラルネットワーク(SNN)の活性化関数とハイパーパramータを共同で最適化する新規の2段階型AutoMLフレームワーク、SAFSを提案する。高いスパarsityレベルにおいて、精度を顕著に向上させる。層別に活性化関数を学習し、ハイパーパramータを別々に最適化することで、LeNet-5、VGG-16、ResNet-18においてMNIST、CIFAR-10、ImageNet-16のデータセット上で、デフォルトの訓練プロトコルに比べて最大15.53%の絶対的精度向上を達成する。

ABSTRACT

Sparse Neural Networks (SNNs) can potentially demonstrate similar performance to their dense counterparts while saving significant energy and memory at inference. However, the accuracy drop incurred by SNNs, especially at high pruning ratios, can be an issue in critical deployment conditions. While recent works mitigate this issue through sophisticated pruning techniques, we shift our focus to an overlooked factor: hyperparameters and activation functions. Our analyses have shown that the accuracy drop can additionally be attributed to (i) Using ReLU as the default choice for activation functions unanimously, and (ii) Fine-tuning SNNs with the same hyperparameters as dense counterparts. Thus, we focus on learning a novel way to tune activation functions for sparse networks and combining these with a separate hyperparameter optimization (HPO) regime for sparse networks. By conducting experiments on popular DNN models (LeNet-5, VGG-16, ResNet-18, and EfficientNet-B0) trained on MNIST, CIFAR-10, and ImageNet-16 datasets, we show that the novel combination of these two approaches, dubbed Sparse Activation Function Search, short: SAFS, results in up to 15.53%, 8.88%, and 6.33% absolute improvement in the accuracy for LeNet-5, VGG-16, and ResNet-18 over the default training protocols, especially at high pruning ratios. Our code can be found at https://github.com/automl/SAFS

研究の動機と目的

  • 高 pruning 確率下におけるスパースニューラルネットワーク(SNN)の精度低下に及ぼす活性化関数とハイパーパramータの影響が十分に検討されていないことに対処する。
  • ReLUがデフォルトの活性化関数であるが、勾配の流れの問題によりSNNの訓練を妨げることがある理由を解明する。
  • 密度のあるネットワークの訓練プロトコルとは異なり、SNNの活性化関数とハイパーパramータを共同で最適化する効率的で自動化された手法を開発する。
  • 特に高スパarsity領域において、標準的な訓練手法から逸脱することでSNNの精度を顕著に向上させられることを示す。
  • プリーニングプロセスを変更せずに適用可能な、スケーラブルでアーキテクチャに依存しないフレームワークを提案する。

提案手法

  • 2段階の最適化パイプラインを提案:まず、微分可能アーキテクチャ探索(DARTS)にインspiredしたコントローラーを用いた離散的探索により、各層ごとに最適なユニタリな活性化関数を学習する。
  • 次に、ベイズ最適化を用いて確率的ハイパーパラメータ最適化(HPO)を実行し、スパースネットワークに特化した学習率、重み減衰などのハイパーパラメータを微調整する。
  • 活性化関数の事前定義された探索空間内で、ReLU、LeakyReLU、Swish、HardSwishを含む関数を探索するためのコントローラーネットワークを用いる。これらの関数には学習可能なパラメータαとβを導入する。
  • SAFS適用前に、密度のあるモデルに対して非構造的マグニチュードプリーニングを適用し、本手法がプリーニングアルゴリズムに依存しないことを保証する。
  • 学習済みの活性化関数と最適化されたハイパーパラメータを用いてSNNを訓練し、MNIST、CIFAR-10、ImageNet-16を含む標準ベンチマークで評価する。
  • 探索フェーズの計算コストを最小化しつつ検証精度を最大化する多目的目的関数を統合する。
(a)
(a)

実験結果

リサーチクエスチョン

  • RQ1特にReLUを含む活性化関数の選択が、高 pruning 確率下でのスパースニューラルネットワークの性能低下にどの程度寄与するか。
  • RQ2活性化関数とハイパーパラメータを共同で最適化することで、標準的な訓練プロトコルを上回るSNNの精度向上が達成可能か。
  • RQ3SNNにおいて、各層ごとに活性化関数を探索する方法と、全層に同一のグローバル活性化関数を適用する方法とを比較した場合、性能差はどの程度生じるか。
  • RQ4SAFSによる性能向上は、LeNet-5、VGG-16、ResNet-18、EfficientNet-B0などの異なるアーキテクチャおよびMNIST、CIFAR-10、ImageNet-16などの異なるデータセットにおいてスケーリング可能か。
  • RQ5本手法はプリーニングアルゴリズムに依存せず、既存のSNNパイプラインに広く適用可能か。

主な発見

  • MNISTで訓練されたLeNet-5において、99%のプリーニング比下で、デフォルトの訓練プロトコル(ReLU使用)に比べ、SAFSは15.53%の絶対的精度向上を達成する。
  • CIFAR-10で訓練されたVGG-16において、99%のプリーニング比下で、SAFSは8.88%の精度向上を達成し、標準的なReLU訓練プロトコルを著しく上回る。
  • CIFAR-10で訓練されたResNet-18において、99%のスパarsity下で、SAFSは6.33%の絶対的精度向上を達成し、深層アーキテクチャにおいても有効であることを示す。
  • アブレーションスタディの結果、SAFSの2段階(活性化関数探索とハイパーパラメータチューニング)がそれぞれ独立して性能向上に寄与しており、フルパイプラインが最高の精度を達成することが確認された。
  • 本手法は多様なアーキテクチャおよびデータセットに対して頑健であり、EfficientNet-B0においても一貫した改善が観察された。ImageNet-16で99%のプリーニング比下で1.54%の精度向上を達成した。
  • 結果から、ReLUはSNNにおいて最適でないことが示され、特に中間層や深層部ではSwishやHardSwishがより効果的であることが判明した。一方、初期層ではReLUがより優れた性能を示した。
(b)
(b)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。