Skip to main content
QUICK REVIEW

[논문 리뷰] Natural-Logarithm-Rectified Activation Function in Convolutional Neural Networks

Yang Liu, Jianpeng Zhang|arXiv (Cornell University)|2019. 08. 10.
Advanced Neural Network Applications참고 문헌 22인용 수 4
한 줄 요약

이 논문은 자연로그 변환을 적용하여 다이잉 ReLU 문제와 기울기 소실 문제를 완화하는 새로운 활성화 함수인 자연로그 수정 선형 단위(NLReLU)를 제안한다. 실험 결과, 얕은 네트워크에서 MNIST에서는 정확도가 0.16% 향상되었고, CIFAR-10에서는 2.04% 향상되었으며, 깊은 CIFAR-10 네트워크에서는 평균 1.35%의 성능 향상을 보였다.

ABSTRACT

Activation functions play a key role in providing remarkable performance in deep neural networks, and the rectified linear unit (ReLU) is one of the most widely used activation functions. Various new activation functions and improvements on ReLU have been proposed, but each carry performance drawbacks. In this paper, we propose an improved activation function, which we name the natural-logarithm-rectified linear unit (NLReLU). This activation function uses the parametric natural logarithmic transform to improve ReLU and is simply defined as. NLReLU not only retains the sparse activation characteristic of ReLU, but it also alleviates the "dying ReLU" and vanishing gradient problems to some extent. It also reduces the bias shift effect and heteroscedasticity of neuron data distributions among network layers in order to accelerate the learning process. The proposed method was verified across ten convolutional neural networks with different depths for two essential datasets. Experiments illustrate that convolutional neural networks with NLReLU exhibit higher accuracy than those with ReLU, and that NLReLU is comparable to other well-known activation functions. NLReLU provides 0.16% and 2.04% higher classification accuracy on average compared to ReLU when used in shallow convolutional neural networks with the MNIST and CIFAR-10 datasets, respectively. The average accuracy of deep convolutional neural networks with NLReLU is 1.35% higher on average with the CIFAR-10 dataset.

연구 동기 및 목표

  • 딥 컨volution 신경망에서 다이잉 ReLU와 기울기 소실 문제 등의 ReLU의 한계를 해결하기 위해.
  • 학습 속도를 가속화하기 위해 네트워크 계층 간 뉴런 활성화의 편향 이동과 이방성(variance heteroscedasticity)을 줄이기 위해.
  • 스패arsity를 유지하면서 기울기 흐름과 모델 성능을 향상시키는 활성화 함수를 개발하기 위해.
  • 다양한 네트워크 아키텍처와 데이터셋에서 제안된 NLReLU의 강건성과 일반화 능력을 평가하기 위해.

제안 방법

  • NLReLU는 x ≥ 0일 때 f(x) = ln(1 + exp(αx))로 정의되며, 여기서 α는 학습 가능한 파라미터로, ReLU의 특성과 자연로그 변환을 조합한다.
  • 파arametric 형태는 입력의 최적 스케일링을 네트워크가 학습할 수 있도록 허용한다.
  • 음수 입력에 대해 출력을 0으로 유지함으로써 ReLU의 스파arsity를 유지하여 계산 효율성을 유지한다.
  • 로그 함수 성분은 큰 양의 입력에 대해 기울기를 부드럽게 하여 다이잉 ReLU의 위험을 줄이고 학습을 안정화시킨다.
  • 이 방법은 MNIST와 CIFAR-10이라는 두 가지 벤치마크 데이터셋에 대해 10개의 서로 다른 컨volution 신경망 아키텍처에 통합되었다.
  • 표준 최적화 프로토콜을 사용하여 학습을 수행하고, 표준 정확도 메트릭을 사용하여 성능를 평가하였다.

실험 결과

연구 질문

  • RQ1파arametric 로그 변환은 깊은 CNN에서 ReLU의 학습 역학을 향상시킬 수 있는가?
  • RQ2기본 ReLU와 비교해 NLReLU는 다이잉 ReLU 문제와 기울기 소실 문제를 효과적으로 줄일 수 있는가?
  • RQ3NLReLU는 계층 간 뉴런 활성화 분포에서 편향 이동과 이방성(variance heteroscedasticity)을 어느 정도 줄이는가?
  • RQ4표준 비전 벤치마크에서 다른 잘 알려진 활성화 함수와 비교해 NLReLU의 성능은 어떠한가?
  • RQ5NLReLU는 다양한 네트워크 깊이와 아키텍처에서 일관되게 정확도를 향상시키는가?

주요 결과

  • MNIST 데이터셋을 사용한 얕은 컨volution 신경망에서 NLReLU는 ReLU 대비 평균 정확도 향상 0.16%를 달성했다.
  • CIFAR-10 데이터셋에서 얕은 네트워크에서는 NLReLU가 ReLU 대비 평균 정확도를 2.04% 향상시켰다.
  • CIFAR-10에서 깊은 컨볼루션 신경망에서는 NLReLU가 ReLU 대비 평균 정확도 향상 1.35%를 기록했다.
  • 제안된 NLReLU는 Leaky ReLU 및 ELU와 같은 잘 알려진 활성화 함수와 비교해 유사한 성능을 보였다.
  • NLReLU는 뉴런 활성화 분포의 편향 이동과 이방성을 효과적으로 줄여 수렴 속도 향상에 기여했다.
  • NLReLU의 파arametric 성격 덕분에 최적의 변환 파라미터를 적응적으로 학습할 수 있어 일반화 능력과 학습 안정성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.