Skip to main content
QUICK REVIEW

[논문 리뷰] Padé Activation Units: End-to-end Learning of Flexible Activation Functions in Deep Networks

Alejandro Molina, Patrick Schramowski|arXiv (Cornell University)|2019. 07. 15.
Advanced Neural Network Applications참고 문헌 34인용 수 16
한 줄 요약

이 논문은 패딩 근사에 기반한 유연하고 적응 가능한 비선형성을 갖는 학습 가능한 활성화 함수인 패딩 활성화 유닛(Padé Activation Units, PAUs)을 소개한다. 이는 끝에서 끝까지 학습 가능한 딥 네트워크를 가능하게 하며, 다양한 벤치마크에서 고정된 활성화 함수나 학습 가능한 활성화 함수를 능가한다. PAUs는 ImageNet에서 최고 성능을 기록했으며, 최소한의 파라미터 오버헤드로 안정적이고 강건한 학습을 보였다.

ABSTRACT

The performance of deep network learning strongly depends on the choice of the non-linear activation function associated with each neuron. However, deciding on the best activation is non-trivial, and the choice depends on the architecture, hyper-parameters, and even on the dataset. Typically these activations are fixed by hand before training. Here, we demonstrate how to eliminate the reliance on first picking fixed activation functions by using flexible parametric rational functions instead. The resulting Padé Activation Units (PAUs) can both approximate common activation functions and also learn new ones while providing compact representations. Our empirical evidence shows that end-to-end learning deep networks with PAUs can increase the predictive performance. Moreover, PAUs pave the way to approximations with provable robustness. https://github.com/ml-research/pau

연구 동기 및 목표

  • 딥 러닝에서 수작업으로 선택된 고정된 활성화 함수에 의존하는 것을 제거하기 위해.
  • 끝에서 끝까지 학습 가능한, 파라미터 효율적인 활성화 함수를 개발하기 위해.
  • 딥 네트워크가 데이터와 아키텍처에 맞게 최적의 활성화 형태를 학습할 수 있도록 하기 위해.
  • 안정적이고 기울기 소멸이 없는 기울기를 갖는 유일한 근사자이며, 최소한의 파라미터 비용으로도 가능하도록 하기 위해.
  • 실증적으로 PAUs가 다양한 아키텍처와 데이터셋에서 예측 성능 향상을 이끌어내는지 검증하기 위해.

제안 방법

  • PAUs는 다항식의 비율 형태인 $ F(x) = \frac{P(x)}{Q(x)} $로 표현된 활성화 함수를 사용한다. 여기서 $ P(x) $와 $ Q(x) $는 각각 차수 $ m $과 $ n $을 갖는 다항식이다.
  • 패딩 근사의 계수는 역전파를 통해 학습되며, 이는 활성화 함수의 끝에서 끝까지 최적화를 가능하게 한다.
  • 수치적 안정성을 보장하고 기울기 폭발을 방지하기 위한 파arameterization 기법을 사용한다.
  • 각 레이어당 추가로 10개의 파라미터만으로도 표준 딥 러닝 프레임워크에 PAUs를 통합할 수 있다.
  • 패딩 근사 이론에 기반하여, 압축되고 표현력 있는 함수 표현이 가능하다.
  • 이론적 분석을 통해 패딩 네트워크가 유일한 근사자임을 보이며, 핵심 기능 가정을 충족함을 입증했다.

실험 결과

연구 질문

  • RQ1유리 함수가 딥 신경망에서 효과적이고 학습 가능한 활성화 함수로 기능할 수 있는가?
  • RQ2패딩 근사를 통한 활성화 함수의 끝에서 끝까지 학습이 고정된 활성화 함수나 수작업 설계된 활성화 함수보다 예측 성능을 향상시키는가?
  • RQ3PAUs는 깊은 네트워크에서 수렴 속도를 높이고 기울기 소멸 문제를 피할 수 있는가?
  • RQ4PAUs는 다양한 아키텍처와 데이터셋, 특히 ImageNet에서 성능이 어떻게 비교되는가?
  • RQ5PAUs를 통해 ReLU 네트워크로의 환원을 통해 증명 가능한 강건성 또는 전역 최적 모델을 도출할 수 있는가?

주요 결과

  • PAUs는 MobileNetV2를 사용해 ImageNet에서 최고의 상위 1위 정확도(71.35%)를 기록했으며, Swish(71.24%) 및 기타 모든 기준 모델을 능가했다.
  • PAUs는 상위 5위 정확도 89.85%를 기록해 Swish(89.95%)에 이어 두 번째로 높은 성능을 보이며 강력한 일반화 능력을 입증했다.
  • 15개 실험 중 12개에서 PAUs가 최고 기준 모델을 능가하거나 동점이었으며, 다양한 아키텍처에서 Swish에 비해 상위 1위 정확도에서 41개 중 41번 승리했다.
  • PAUs는 모든 다른 활성화 함수보다 수렴 속도가 빠르고 학습 손실이 낮아 안정적이고 효율적인 학습을 보였다.
  • 다양한 모델에서 41개의 실험 중 34~41개에서 PAUs가 모든 기준 모델을 능가했으며, 기준 모델당 최대 1~8번의 패배만 기록했다.
  • 빠른 학습 곡선과 관측된 기울기 소멸 현상이 없음을 통해 PAUs는 기울기 문제에 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.