Skip to main content
QUICK REVIEW

[논문 리뷰] Empirical analysis of non-linear activation functions for Deep Neural Networks in classification tasks

Giovanni Alcantara|arXiv (Cornell University)|2017. 10. 30.
Adversarial Robustness in Machine Learning참고 문헌 6인용 수 15
한 줄 요약

이 논문은 고정된 초모수와 깊이 변화를 고려하여 MNIST 이미지 분류를 위한 딥 네ural 네트워크에서 Sigmoid, ReLU, Leaky ReLU, ELU, SELU의 다섯 가지 비선형 활성화 함수를 실증적으로 평가한다. 실험 결과 ELU가 다른 활성화 함수보다 뛰어난 성능을 보였으며, 최적의 성능은 3개의 은닉층, 학습률 0.02, 조기 정지, Glorot 균일 가중치 초기화를 사용할 때 달성되었으며, 이때 테스트 정확도는 97.9%에 이르렀다.

ABSTRACT

We provide an overview of several non-linear activation functions in a neural network architecture that have proven successful in many machine learning applications. We conduct an empirical analysis on the effectiveness of using these function on the MNIST classification task, with the aim of clarifying which functions produce the best results overall. Based on this first set of results, we examine the effects of building deeper architectures with an increasing number of hidden layers. We also survey the impact of using, on the same task, different initialisation schemes for the weights of our neural network. Using these sets of experiments as a base, we conclude by providing a optimal neural network architecture that yields impressive results in accuracy on the MNIST classification task.

연구 동기 및 목표

  • 딥 네럴 네트워크에서 주요 비선형 활성화 함수의 실증적 성능을 이미지 분류 작업에 대해 평가하는 것.
  • 통제된 학습 조건 하에서 MNIST 데이터셋에 최적의 활성화 함수를 규명하는 것.
  • 네트워크 깊이와 가중치 초기화 방법의 모델 정확도 및 일반화 능력에 미치는 영향을 조사하는 것.
  • 활성화 함수, 학습률, 깊이, 초기화 방법을 조합한 최고 성능의 아키텍처 구성 요건을 규명하는 것.

제안 방법

  • MNIST 데이터셋(학습 이미지 60,000장, 검증 이미지 10,000장)에서 Sigmoid, ReLU, Leaky ReLU, ELU, SELU의 다섯 가지 활성화 함수를 실증적으로 평가.
  • 고정된 학습 설정: 100 에포크, 배치 크기 50, 학습률 0.02, 0.05, 0.10, 2은닉층 기준 아키텍처.
  • 은닉층 수를 2에서 8로 변화시키며 깊이를 체계적으로 변화시킨 아블레이션 연구를 수행하고, Glorot, fan-in, fan-out의 세 가지 가중치 초기화 방법을 테스트.
  • 특히 깊은 아키텍처에서 과적합을 완화하기 위해 조기 정지를 적용.
  • 평가 지표로는 검증 오차, 학습 및 검증 정확도, 모든 에포크 동안의 학습 곡선을 포함.
  • 최종 검증 정확도와 수렴 행동을 기준으로 활성화 함수 간 성능을 비교.

실험 결과

연구 질문

  • RQ1동일한 학습 조건 하에서 어떤 비선형 활성화 함수가 MNIST 데이터셋에서 가장 높은 분류 정확도를 달성하는가?
  • RQ2은닉층 수를 늘일수록 모델 성능과 일반화 능력은 어떻게 영향을 받는가? 특히 과적합과의 관계에서 어떻게 되는가?
  • RQ3다른 가중치 초기화 방법(Glorot, fan-in, fan-out)은 학습 안정성과 최종 모델 정확도에 어떤 영향을 미치는가?
  • RQ4조기 정지는 더 깊은 네트워크에서 검증 정확도를 향상시킬 수 있는가? 만약 가능하면 얼마나 향상되는가?

주요 결과

  • ELU는 테스트된 모든 활성화 함수 중에서 최고의 최종 검증 정확도 97.9%를 기록했으며, ReLU, Leaky ReLU, SELU, Sigmoid를 모두 앞섰다.
  • ELU 활성화 함수를 사용한 3은닉층의 더 깊은 아키텍처가 2층 기준선보다 뛰어난 성능을 보였으며, 이는 표현 능력 향상의 증거로 볼 수 있다.
  • Glorot/Xavier 균일 초기화 방법은 fan-in 및 fan-out 초기화를 항상 뛰어나게 하였으며, 가장 낮은 검증 오차와 가장 높은 정확도를 기록했다.
  • 8층까지의 깊은 아키텍처에서는 제100 에포크 기준 검증 오차가 높아져 과적합 경향이 뚜렷했으며, 이는 조기 정지를 통해 완화되었다.
  • 학습률 0.02가 수렴성과 정확도 사이의 최적의 균형을 이룩했고, 0.10은 모든 활성화 함수에서 안정성 문제와 열악한 성능을 유발했다.
  • 최적의 모델 구성—ELU 활성화, 학습률 0.02, 3은닉층, Glorot 초기화, 조기 정지—는 97.9%의 테스트 정확도를 달성하여 뛰어난 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.