Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Deep Neural Network with Multiple Parametric Exponential Linear Units

Yang Li, Chunxiao Fan|arXiv (Cornell University)|2016. 06. 01.
Advanced Neural Network Applications참고 문헌 34인용 수 11
한 줄 요약

이 논문은 음의 영역에서 선형 및 비선형 표현을 통합하기 위해 학습 가능한 매개변수 α와 β를 도입함으로써 ReLU, PReLU, ELU를 일반화하는 새로운 활성화 함수인 다중 매개변수 지수선형 단위(MPELU)를 제안한다. MPELU는 수렴 속도를 향상시키고 일반화 성능을 향상시키며, 배치 정규화와 새로운 가중치 초기화 방법과 조합할 경우, 깊이 있는 잔차 신경망을 사용하여 CIFAR-10(3.57% 오차)과 CIFAR-100(18.81% 오차)에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Activation function is crucial to the recent successes of deep neural networks. In this paper, we first propose a new activation function, Multiple Parametric Exponential Linear Units (MPELU), aiming to generalize and unify the rectified and exponential linear units. As the generalized form, MPELU shares the advantages of Parametric Rectified Linear Unit (PReLU) and Exponential Linear Unit (ELU), leading to better classification performance and convergence property. In addition, weight initialization is very important to train very deep networks. The existing methods laid a solid foundation for networks using rectified linear units but not for exponential linear units. This paper complements the current theory and extends it to the wider range. Specifically, we put forward a way of initialization, enabling training of very deep networks using exponential linear units. Experiments demonstrate that the proposed initialization not only helps the training process but leads to better generalization performance. Finally, utilizing the proposed activation function and initialization, we present a deep MPELU residual architecture that achieves state-of-the-art performance on the CIFAR-10/100 datasets. The code is available at https://github.com/Coldmooon/Code-for-MPELU.

연구 동기 및 목표

  • 직선형 및 지수선형 단위 간의 표현 갭을 해소하기 위해, 둘의 능력을 하나의 활성화 함수에 통합하고자 한다.
  • 새로운 가중치 초기화 방법을 제안하여 지수선형 단위를 사용한 매우 깊은 네트워크의 효과적인 훈련을 가능하게 하고자 한다.
  • PReLU와 ELU의 장점을 통합한 학습 가능한 적응형 활성화 함수를 통해 깊이 있는 네트워크의 일반화 및 수렴 성능을 향상시키고자 한다.
  • MPELU가 표준 ELU와 달리 배치 정규화와 효과적으로 작동함을 보여주어, 잔차 아키텍처에서 성능 향상을 이끌어내고자 한다.

제안 방법

  • MPELU를 ELU의 일반화로 제안하며, MPELU(x) = α * (e^(β*x) - 1) for x < 0 및 MPELU(x) = x for x ≥ 0로 정의되며, 학습 가능한 매개변수 α와 β를 포함한다.
  • 지수선형 단위를 위한 특화된 새로운 가중치 초기화 방법을 도입하여 매우 깊은 네트워크에서 훈련을 안정화시키는 해석적 해를 제공한다.
  • α와 β에 대해 채널 별 또는 채널 공유 초기화를 적용하여 파라미터 증가를 최소화하면서도 적응형 학습을 가능하게 한다.
  • 배치 정규화를 활용하여 훈련 동역학을 향상시키기 위해 MPELU를 잔차 신경망 아키텍처(MPELU ResNet)에 통합한다.
  • 역전파 동안 네트워크 가중치와 함께 MPELU의 매개변수 α와 β를 함께 최적화하기 위해 확률적 경사 하강법을 사용한다.
  • 일반화 성능 향상을 위해 데이터 증강 및 공격적인 훈련 전략을 적용하며, 특히 CIFAR-10/100에서 두드러진다.

실험 결과

연구 질문

  • RQ1ReLU/PReLU와 ELU 간의 표현 갭을 메울 수 있는 통합된 활성화 함수를 설계할 수 있는가?
  • RQ2ELU에 학습 가능한 매개변수 α와 β를 도입하면 깊이 있는 네트워크에서 수렴 속도와 분류 정확도가 향상되는가?
  • RQ3새로운 가중치 초기화 방법을 통해 지수선형 단위를 사용한 매우 깊은 네트워크의 안정적 훈련이 가능해지는가?
  • RQ4배치 정규화와 함께 사용했을 때 MPELU가 ELU보다 성능이 뛰어난가? 만약 그렇다면 그 이유는 무엇인가?
  • RQ5MPELU 기반의 잔차 신경망은 CIFAR-10과 CIFAR-100에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 1001층의 ResNet을 사용하여 MPELU 활성화 함수는 CIFAR-10에서 3.57%의 테스트 오차, CIFAR-100에서 18.81%의 테스트 오차를 기록하며 원래의 Pre-ResNet을 초월한다.
  • 제안된 가중치 초기화 방법은 이전에 부적절한 초기화로 인해 어려웠던 지수선형 단위를 사용한 매우 깊은 네트워크의 안정적 훈련을 가능하게 한다.
  • 특히 배치 정규화와 조합했을 때 MPELU 네트워크는 PReLU 및 ELU 네트워크보다 더 빠르게 수렴하고 일반화 성능이 뛰어나다.
  • 실험 결과, 배치 정규화가 ELU 기반 네트워크에는 해로운 영향을 미치지만 MPELU 기반 네트워크에는 유익한 영향을 미치며, 이는 MPELU의 아키텍처 설계가 이 문제를 완화시킨다는 것을 시사한다.
  • α와 β의 학습 가능한 매개변수 도입으로 인해 모델의 표현 능력이 향상되며, 추가 파라미터 수가 극히 적어 과적합 위험도 크게 증가하지 않는다.
  • MPELU ResNet 아키텍처는 CIFAR-10과 CIFAR-100 양쪽에서 최신 기술 수준의 성능을 달성하여 제안된 활성화 함수와 초기화 방법의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.