Skip to main content
QUICK REVIEW

[논문 리뷰] Training Neural Networks by Using Power Linear Units (PoLUs)

Yikang Li, Pak Lun Kevin Ding|arXiv (Cornell University)|2018. 02. 01.
Advanced Neural Network Applications참고 문헌 19인용 수 8
한 줄 요약

이 논문은 양성 입력에 대해 신뢰성 있는 기울기 유지 기능을 제공하고 음성 입력에 대해 거듭제곱 함수를 적용함으로써 비선형성을 향상시키는 새로운 신경망 활성화 함수인 파wr 린어 유닛(PoLUs)을 제안한다. PoLUs는 기울기 소실을 줄이고 편향 이동을 완화하며 반응 영역을 증가시켜 ResNet-50와 VGG16를 포함한 다양한 아키텍처에서 MNIST, CIFAR-10, CIFAR-100, SVHN 및 ImageNet에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we introduce "Power Linear Unit" (PoLU) which increases the nonlinearity capacity of a neural network and thus helps improving its performance. PoLU adopts several advantages of previously proposed activation functions. First, the output of PoLU for positive inputs is designed to be identity to avoid the gradient vanishing problem. Second, PoLU has a non-zero output for negative inputs such that the output mean of the units is close to zero, hence reducing the bias shift effect. Thirdly, there is a saturation on the negative part of PoLU, which makes it more noise-robust for negative inputs. Furthermore, we prove that PoLU is able to map more portions of every layer's input to the same space by using the power function and thus increases the number of response regions of the neural network. We use image classification for comparing our proposed activation function with others. In the experiments, MNIST, CIFAR-10, CIFAR-100, Street View House Numbers (SVHN) and ImageNet are used as benchmark datasets. The neural networks we implemented include widely-used ELU-Network, ResNet-50, and VGG16, plus a couple of shallow networks. Experimental results show that our proposed activation function outperforms other state-of-the-art models with most networks.

연구 동기 및 목표

  • ReLU의 한계, 즉 죽은 뉴런과 편향 이동 문제를 해결하기 위해 더 강력한 활성화 함수를 설계하기 위해.
  • 반응 영역의 다양성을 향상시켜 깊은 신경망의 비선형성 능력을 향상시키기 위해.
  • 기존 함수들인 ELU와 같이 지수 함수에 의해 결합된 기울기와 포화 특성과는 달리, 음성 활성화 영역에서 기울기와 포화를 독립적으로 제어할 수 있도록 유연한 기능을 제공하기 위해.
  • 다양한 아키텍처와 데이터셋, 특히 배치 정규화가 없는 환경에서 PoLU의 우수성을 경험적으로 검증하기 위해.

제안 방법

  • PoLU는 양성 입력에 대해 항등 함수(f(x) = x)를 사용하여 기울기 소실을 방지한다.
  • 음성 입력에 대해서는 거듭제곱 함수(f(x) = -|x|^n, x < 0, n > 1)를 적용하여 포화 효과와 노이즈에 대한 강건성을 확보한다.
  • 거듭제곱 파ameter n은 ELU와 달리 기울기와 포화를 별도로 제어할 수 있도록 해주며, 이는 전통적인 함수들에 비해 더 큰 유연성을 제공한다.
  • 음성 입력에 대해 비영인 출력을 유지함으로써 평균 활성화 이동을 줄이고 편향 이동을 완화한다.
  • 이론적 분석을 통해 PoLU는 한 층 내의 반응 영역 수를 증가시켜 표현 능력을 향상시킨다.
  • 실험적으로는 ResNet-50와 VGG16를 포함한 여러 네트워크와 데이터셋에서 PoLU를 ReLU, ELU, PReLU, Leaky ReLU와 비교하여 평가한다.

실험 결과

연구 질문

  • RQ1음성 영역에서 거듭제곱 기반 활성화 함수가 ReLU와 ELU를 초월해 깊은 네트워크 성능을 향상시킬 수 있는가?
  • RQ2음성 활성화 영역에서 기울기와 포화를 독립적으로 제어할 경우, 더 나은 일반화 성능과 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ3PoLU는 ReLU와 ELU에 비해 반응 영역 수를 얼마나 증가시키는가?
  • RQ4배치 정규화가 없는 환경에서 PoLU는 다양한 네트워크 아키텍처와 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ5기울기 안정성과 표현 능력의 균형을 고려할 때, 거듭제곱 파ameter n의 최적 값은 무엇인가?

주요 결과

  • PoLU는 MNIST, CIFAR-10, CIFAR-100, SVHN 및 ImageNet에서 다양한 아키텍처에서 ReLU, ELU 및 기타 최신 기술 수준의 활성화 함수를 능가한다.
  • ImageNet에서 PoLU 기반 네트워크는 초기 학습 동안 ELU와 유사한 행동를 보였지만, 마지막 학습 에포크에서는 더 높은 최종 정확도와 더 낮은 손실을 기록했다.
  • PoLU는 에포크당 계산 시간이 약 5% 증가했음에도 불구하고, ReLU와 유사한 학습 손실에 더 적은 에포크 수로 도달했다.
  • n=2일 때가 시험한 값들 중에서 가장 우수한 성능을 보였고, n>2일 경우 영역 근처에서 기울기가 과도하게 증가해 안정성이 떨어졌다.
  • 배치 정규화가 없는 깊은 네트워크에서 PoLU와 ReLU 간의 성능 격차가 가장 두드러졌으며, 이는 PoLU가 편향 이동을 효과적으로 완화함을 시사한다.
  • 완전 연결 계층을 포함한 네트워크에서는 PoLU, ELU, ReLU 간 성능 격차가 감소했으며, 이는 활성화 함수의 성능 향상이 아키텍처에 따라 달라질 수 있음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.