Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Activation Functions for Sparse Neural Networks

Mohammad Loni, Aditya Mohan|arXiv (Cornell University)|2023. 05. 18.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 희소 신경망(SNNs)에 대해 활성화 함수와 하이퍼파rameter를 동시에 최적화하는 새로운 이중 단계 AutoML 프레임워크인 SAFS를 제안한다. 이는 고도의 희소성 수준에서 정확도를 크게 향상시킨다. 각 레이어의 활성화 함수를 별도로 학습하고 하이퍼파rameter를 정밀하게 조정함으로써, LeNet-5, VGG-16, ResNet-18에서 MNIST, CIFAR-10, ImageNet-16 데이터셋에 대해 기본 학습 프rotocol 대비 최대 15.53%p의 정확도 향상을 달성한다.

ABSTRACT

Sparse Neural Networks (SNNs) can potentially demonstrate similar performance to their dense counterparts while saving significant energy and memory at inference. However, the accuracy drop incurred by SNNs, especially at high pruning ratios, can be an issue in critical deployment conditions. While recent works mitigate this issue through sophisticated pruning techniques, we shift our focus to an overlooked factor: hyperparameters and activation functions. Our analyses have shown that the accuracy drop can additionally be attributed to (i) Using ReLU as the default choice for activation functions unanimously, and (ii) Fine-tuning SNNs with the same hyperparameters as dense counterparts. Thus, we focus on learning a novel way to tune activation functions for sparse networks and combining these with a separate hyperparameter optimization (HPO) regime for sparse networks. By conducting experiments on popular DNN models (LeNet-5, VGG-16, ResNet-18, and EfficientNet-B0) trained on MNIST, CIFAR-10, and ImageNet-16 datasets, we show that the novel combination of these two approaches, dubbed Sparse Activation Function Search, short: SAFS, results in up to 15.53%, 8.88%, and 6.33% absolute improvement in the accuracy for LeNet-5, VGG-16, and ResNet-18 over the default training protocols, especially at high pruning ratios. Our code can be found at https://github.com/automl/SAFS

연구 동기 및 목표

  • 높은 프루닝 비율에서 희소 신경망(SNNs)의 정확도 저하에 활성화 함수와 하이퍼파arameter가 미치는 영향이 다소 간과되고 있음을 해결한다.
  • ReLU가 기본 활성화 함수로 사용되지만, 기울기 흐름 문제로 인해 SNN 학습을 저해할 수 있는 이유를 탐구한다.
  • 밀도 네트워크 학습 프rotocol과는 다를 바 있는 효율적이고 자동화된 방법을 개발하여 SNN의 활성화 함수와 하이퍼파arameter를 동시에 최적화한다.
  • 특히 고희소성 영역에서 표준 학습 관행을 벗어나면 SNN의 정확도를 크게 향상시킬 수 있음을 입증한다.
  • 모든 SNN에 대해 프루닝 과정을 수정하지 않고 적용 가능한 확장성 있고 아키텍처에 종속되지 않는 프레임워크를 제안한다.

제안 방법

  • 이중 단계 최적화 파이프라인 제안: 첫 번째 단계에서는 DARTS 영감을 받은 제어망을 사용한 미분 가능 아키텍처 탐색 기반 이산 탐색을 통해 각 레이어별 최적의 단항 활성화 함수를 학습한다.
  • 두 번째 단계에서는 베이지안 최적화를 활용한 확률적 하이퍼파aram터 최적화(HPO)를 수행하여 학습률, 가중치 감쇠 등 SNN에 특화된 하이퍼파aram터를 정밀하게 조정한다.
  • 사전 정의된 활성화 함수 검색 공간에서 제어망을 사용하여 ReLU, LeakyReLU, Swish, HardSwish를 포함한 활성화 함수를 탐색하며, 학습 가능한 파라미터 α와 β를 포함한다.
  • SAFS 적용 이전에 밀도 모델에 비구조적 크기 기반 프루닝을 적용하여, 이 방법이 프루닝 알고리즘과 독립적임을 보장한다.
  • 학습된 활성화 함수와 최적화된 하이퍼파aram터를 사용해 SNN을 학습하고, MNIST, CIFAR-10, ImageNet-16와 같은 표준 벤치마크에서 평가한다.
  • 검색 단계의 계산 비용을 최소화하면서 검증 정확도를 극대화하는 다목적 목적 함수를 통합하여 검색 과정을 통합한다.
(a)
(a)

실험 결과

연구 질문

  • RQ1특히 ReLU와 같은 활성화 함수의 선택이 고도의 프루닝 비율에서 SNN의 성능 저하에 얼마나 기여하는가?
  • RQ2활성화 함수와 하이퍼파aram터를 동시에 최적화하면 표준 학습 프rotocol을 초월해 SNN의 정확도를 향상시킬 수 있는가?
  • RQ3모든 레이어에 동일한 전역 활성화 함수를 사용하는 것과 비교해, 각 레이어별 활성화 함수 탐색이 SNN에서 어떤 성능 향상을 가져오는가?
  • RQ4SAFS의 성능 향상은 LeNet-5, VGG-16, ResNet-18, EfficientNet-B0 등의 다양한 아키텍처와 MNIST, CIFAR-10, ImageNet-16 등의 다양한 데이터셋에서 스케일링되는가?
  • RQ5제안된 방법은 프루닝 알고리즘과 독립적으로 적용 가능하여 기존의 SNN 파이프라인에 넓게 적용 가능한가?

주요 결과

  • MNIST에서 훈련된 LeNet-5에 대해 99% 프루닝 비율에서 SAFS는 기본 학습 프로토콜(ReLU 사용) 대비 15.53%p의 정확도 향상을 달성한다.
  • CIFAR-10에서 훈련된 VGG-16에 대해 99% 프루닝 비율에서 SAFS는 정확도를 8.88%p 향상시켜 표준 학습(ReLU 사용)을 크게 능가한다.
  • CIFAR-10에서 훈련된 ResNet-18에 대해 99% 희소성 수준에서 SAFS는 6.33%p의 정확도 향상을 보이며, 더 깊은 아키텍처에서도 효과를 입증한다.
  • 제거 분석 결과, SAFS의 두 단계—활성화 함수 탐색과 하이퍼파aram터 조정—이 각각 성능 향상에 기여하며, 전체 파이프라인에서 가장 높은 정확도를 기록한다.
  • 이 방법은 다양한 아키텍처와 데이터셋에서 뛰어난 강건성을 보이며, EfficientNet-B0에서도 일관된 향상을 보여, ImageNet-16에서 99% 프루닝 비율에서 1.54%p의 정확도 향상을 달성한다.
  • 결과는 ReLU가 SNN에 최적화되어 있지 않으며, 특히 중간 및 깊은 레이어에서는 Swish와 HardSwish가 더 효과적임을 시사한다. 반면, 초기 레이어에서는 ReLU가 더 나은 성능을 보인다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.