Skip to main content
QUICK REVIEW

[논문 리뷰] Approximating Activation Functions

Nicholas Gerard Timmons, Andrew Rice|arXiv (Cornell University)|2020. 01. 17.
Machine Learning and Algorithms참고 문헌 20인용 수 11
한 줄 요약

이 논문은 신경망, 특히 LSTMs에서 사용되는 시그모이드 및 하이퍼볼릭 탄젠트 활성화 함수에 대해 빠르고 정확한 근사치를 제안한다. 함수 근사 기법을 사용하여 안전하고 도메인 제한된 근사치를 개발하였으며, CPU에서는 훈련 시간을 10–37% 감소시키고 입력 도메인 제약 조건이 있을 경우 20–53% 감소시켰다. 이는 Theano와 Word2Vec에서 사용되는 기존 구현보다 성능이 뛰어나다.

ABSTRACT

ReLU is widely seen as the default choice for activation functions in neural networks. However, there are cases where more complicated functions are required. In particular, recurrent neural networks (such as LSTMs) make extensive use of both hyperbolic tangent and sigmoid functions. These functions are expensive to compute. We used function approximation techniques to develop replacements for these functions and evaluated them empirically on three popular network configurations. We find safe approximations that yield a 10% to 37% improvement in training times on the CPU. These approximations were suitable for all cases we considered and we believe are appropriate replacements for all networks using these activation functions. We also develop ranged approximations which only apply in some cases due to restrictions on their input domain. Our ranged approximations yield a performance improvement of 20% to 53% in network training time. Our functions also match or considerably out perform the ad-hoc approximations used in Theano and the implementation of Word2Vec.

연구 동기 및 목표

  • 신경망에서 비용이 많이 들는 활성화 함수인 시그모이드와 탄젠트의 계산 비용을 줄이기 위해.
  • 모델 정확도를 유지하면서 훈련 속도를 향상시키는 실용적이고 경험적으로 검증된 근사치를 개발하기 위해.
  • 머신러닝 라이브러리에서 표준 활성화 함수의 즉각적인 대체품을 제공하기 위해.
  • 다양한 네트워크 아키텍처에서 근사치의 훈련 및 추론 성능에 미치는 영향을 평가하기 위해.
  • 이러한 근사치가 Theano와 Word2Vec과 같은 인기 있는 프레임워크에서 사용되는 기존의 수월한 구현보다 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 합리적 및 지수 근사 기법을 사용하여 시그모이드용 sigm_fastexp_512, 탄젠트용 tanh_pade_4_4라는 두 가지 안전한 근사치를 제안하였다.
  • 성능 향상을 위해 더 높은 성능을 얻기 위해 특정 입력 도메인에만 적용되는 범위 제한된 근사치를 개발하였다.
  • 훈련 및 추론 시간 향상 평가를 위해 세 가지 인기 있는 신경망 아키텍처에서 경험적 벤치마킹을 수행하였다.
  • 성능 향상을 검증하기 위해 CPU 기반의 훈련 및 추론 워크로드를 사용하였다.
  • Julia의 Flux 라이브러리에 근사치를 구현하고, 성능 비교를 통해 텐서플로우에서도 검증하였다.
  • 여러 모델과 데이터셋에서 훈련 시간, 손실, 수렴 성능를 측정하여 근사치를 검증하였다.

실험 결과

연구 질문

  • RQ1함수 근사 기법을 시그모이드 및 탄젠트 활성화 함수에 효과적으로 적용하여 정확도를 해치지 않으면서 훈련 시간을 줄일 수 있는가?
  • RQ2제안된 안전하고 범위 제한된 근사치는 Theano와 Word2Vec에서 사용되는 기존 근사치와 비교해 성능과 정확도 측면에서 어떻게 다른가?
  • RQ3이러한 근사치가 LSTMs와 피드포워드 네트워크와 같은 실제 신경망 아키텍처에 미치는 성능 영향은 어떠한가?
  • RQ4근사치가 훈련 수렴과 손실 안정성에 얼마나 큰 영향을 미치는가?
  • RQ5이러한 근사치는 메인스트림 머신러닝 라이브러리에 즉시 대체 가능한 형태로 효과적으로 통합될 수 있는가?

주요 결과

  • 안전한 근사치인 sigm_fastexp_512와 tanh_pade_4_4는 모든 테스트된 네트워크에서 훈련 시간을 10%에서 37% 감소시켰으며, 모델 정확도에 영향을 주지 않았다.
  • 범위 제한된 근사치는 훈련 시간에서 20%에서 53%의 성능 향상을 달성했지만, 특정 입력 도메인에 국한된다.
  • 근사치는 Theano와 Word2Vec에서 사용되는 수월한 근사치보다 성능과 훈련 안정성 측면에서 뛰어나다.
  • 새로운 근사치를 사용한 훈련 손실은 안정적이거나 향상되었으며, 모델 수렴에 부정적인 영향이 없음을 시사한다.
  • 근사치는 훈련뿐만 아니라 추론에도 효과적이었으며, 광범위한 적용 가능성을 보였다.
  • 경험적 평가를 통해 근사치가 머신러닝 라이브러리의 표준 활성화 함수에 대한 실용적인 즉시 대체품으로 유효하다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.