Skip to main content
QUICK REVIEW

[논문 리뷰] A Methodology for Automatic Selection of Activation Functions to Design Hybrid Deep Neural Networks

Alberto Marchisio, Muhammad Abdullah Hanif|arXiv (Cornell University)|2018. 10. 27.
Neural Networks and Applications참고 문헌 16인용 수 13
한 줄 요약

이 논문은 딥 네ural 네트워크에서 레이어 간에 최적의 활성화 함수(ReLU, ELU, SELU)와 드롭아웃 비율을 자동으로 선택하는 방법론을 제안한다. 초기 평가 지점(EP)을 활용하여 학습 시간을 4배에서 7배 감소시키면서 MNIST, CIFAR-10, CIFAR-100 벤치마크에서 정확도 오차를 7%에서 15%까지 상대적으로 감소시킨다. 성능 및 전력 소모는 최소한으로 유지된다.

ABSTRACT

Activation functions influence behavior and performance of DNNs. Nonlinear activation functions, like Rectified Linear Units (ReLU), Exponential Linear Units (ELU) and Scaled Exponential Linear Units (SELU), outperform the linear counterparts. However, selecting an appropriate activation function is a challenging problem, as it affects the accuracy and the complexity of the given DNN. In this paper, we propose a novel methodology to automatically select the best-possible activation function for each layer of a given DNN, such that the overall DNN accuracy, compared to considering only one type of activation function for the whole DNN, is improved. However, an associated scientific challenge in exploring all the different configurations of activation functions would be time and resource-consuming. Towards this, our methodology identifies the Evaluation Points during learning to evaluate the accuracy in an intermediate step of training and to perform early termination by checking the accuracy gradient of the learning curve. This helps in significantly reducing the exploration time during training. Moreover, our methodology selects, for each layer, the dropout rate that optimizes the accuracy. Experiments show that we are able to achieve on average 7% to 15% Relative Error Reduction on MNIST, CIFAR-10 and CIFAR-100 benchmarks, with limited performance and power penalty on GPUs.

연구 동기 및 목표

  • 딥 네럴 네트워크(DNN)에서 레이어 간 최적의 활성화 함수를 선택하는 데 도전하는 것. 이는 정확도와 복잡성에 큰 영향을 미친다.
  • 큰 DNN에서 레이어 간 모든 가능한 활성화 함수 조합을 탐색하는 데 드는 계산 비용을 줄이는 것. 이는 대규모 DNN에서는 실현 불가능하다.
  • 다른 레이어가 서로 다른 활성화 함수(ReLU, ELU, SELU)를 사용하는 하이브리드 DNN 아키텍처를 가능하게 하여 성능을 향상시키는 것.
  • 특히 SELU와 함께 알파 드롭아웃을 사용하여 자기정규화 성질을 유지하기 위해, 각 레이어별 최적의 드롭아웃 비율을 자동으로 결정하는 것.
  • 정확도 기울기 분석을 바탕으로 초기 평가 지점(EP)을 식별하여 초기 하이퍼파ram터 탐색 동안 학습 시간을 최소화하는 것.

제안 방법

  • 모든 학습 에포크 후 정확도 곡선의 기울기 기반 분석을 사용하여 최적의 평가 지점(EP)을 식별함으로써, 조기에 모델을 비교할 수 있도록 한다.
  • EP에서 레이어 간 다양한 활성화 함수 설정의 정확도를 평가하여, 열악한 설정은 조기에 종료할 수 있도록 한다.
  • 이 방법은 세 가지 활성화 함수를 지원한다: ReLU(기본 드롭아웃 사용), ELU(기본 드롭아웃 사용), SELU(알파 드롭아웃 사용)로 자기정규화 성질을 유지한다.
  • 각 레이어에서 활성화 함수와 드롭아웃 비율을 동시에 최적화하여 최종 정확도를 극대화하고 학습 시간을 최소화한다.
  • EP는 정확도 기울기를 모니터링하여 자동으로 선택되며, 실험 결과 EP에서 비교해도 전체 학습과 유사한 결과를 얻을 수 있다.
  • 최종 출력은 각 레이어별로 다른 활성화 함수와 드롭아웃 비율을 가진 하이브리드 DNN로, 다양한 벤치마크에서 검증된다.

실험 결과

연구 질문

  • RQ1선택된 레이어에서 ReLU를 ELU 또는 SELU로 대체하면, 학습 시간을 크게 증가시키지 않고 DNN 정확도를 향상시킬 수 있는가?
  • RQ2모델 설정을 조기에 선택하기 위해 학습 중 어떤 시점에서 평가를 수행할 수 있으며, 이는 최종 정확도를 떨어뜨리지 않는가?
  • RQ3다른 활성화 함수를 사용할 경우, 특히 SELU와 함께 알파 드롭아웃을 사용할 때 드롭아웃 비율을 레이어별로 어떻게 적응시킬 수 있는가?
  • RQ4정확도 추세를 기반으로 한 조기 정지 전략을 통해 활성화 함수 설정 탐색을 가속화할 수 있는가?
  • RQ5초기 평가 지점(EP)을 사용할 경우, 학습 시간 단축과 정확도 향상 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • 이 방법론은 원래 DNN에 비해 MNIST, CIFAR-10, CIFAR-100 벤치마크에서 정확도 오차를 7%에서 15%까지 상대적으로 감소시켰다.
  • 학습 시간 감소율(TTR)은 네트워크와 데이터셋에 따라 3.75배에서 7.22배까지 변동하였다. 이는 EP에서의 조기 평가 덕분이었다.
  • LeNet-5(MNIST)에서 최적의 하이브리드 모델은 EP=13에서 99.26%의 정확도를 달성했으며, RER는 17.78%, TTR는 2.31배였다.
  • AlexNet(CIFAR-10)에서 하이브리드 모델은 7.11%의 RER를 기록했고, TTR는 7.22배였으며 전력 소모는 오직 1.94% 증가에 그쳤다.
  • VGG-16(CIFAR-100)에서 이 방법론은 TTR 4.48%와 RER 15.56%를 기록하여 더 깊은 아키텍처에서도 확장 가능성을 입증했다.
  • 기울기 분석을 통해 선정된 EP는 전체 학습과 유사한 정확도를 제공하여, 조기 정지 전략의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.