Skip to main content
QUICK REVIEW

[논문 리뷰] Soft-Root-Sign Activation Function

Yuan Zhou, Dandan Li|arXiv (Cornell University)|2020. 03. 01.
Advanced Neural Network Applications참고 문헌 46인용 수 16
한 줄 요약

이 논문은 ReLU의 단점을 보완하기 위해 훈련 가능한 파rameter를 사용해 영점 평균 활성화와 개선된 분포 안정성을 달성하는 새로운 부드럽고 비단조화적이며 유계 활성화 함수인 Soft-Root-Sign(SRS)을 제안한다. SRS는 이미지 분류, 기계 번역, 생성 모델링에서 ReLU 및 기타 최첨단 활성화 함수를 능가하며, 추론 분석을 통해 배치 정규화와의 호환성과 가중치 초기화에 대한 강건성을 확인한다.

ABSTRACT

The choice of activation function in deep networks has a significant effect on the training dynamics and task performance. At present, the most effective and widely-used activation function is ReLU. However, because of the non-zero mean, negative missing and unbounded output, ReLU is at a potential disadvantage during optimization. To this end, we introduce a novel activation function to manage to overcome the above three challenges. The proposed nonlinearity, namely "Soft-Root-Sign" (SRS), is smooth, non-monotonic, and bounded. Notably, the bounded property of SRS distinguishes itself from most state-of-the-art activation functions. In contrast to ReLU, SRS can adaptively adjust the output by a pair of independent trainable parameters to capture negative information and provide zero-mean property, which leading not only to better generalization performance, but also to faster learning speed. It also avoids and rectifies the output distribution to be scattered in the non-negative real number space, making it more compatible with batch normalization (BN) and less sensitive to initialization. In experiments, we evaluated SRS on deep networks applied to a variety of tasks, including image classification, machine translation and generative modelling. Our SRS matches or exceeds models with ReLU and other state-of-the-art nonlinearities, showing that the proposed activation function is generalized and can achieve high performance across tasks. Ablation study further verified the compatibility with BN and self-adaptability for different initialization.

연구 동기 및 목표

  • ReLU의 한계, 즉 영점 평균이 아닌 활성화, 음수 값의 손실(음수 누락), 무한대에 가까운 출력으로 인한 최적화 및 일반화의 어려움을 해결하기 위해.
  • 부드럽고 비단조화적이며 유계인 새로운 활성화 함수를 설계하여 적응 가능한 파rameter를 통해 활성화 분포의 안정성을 높이기 위해.
  • 딥 네트워크에서 배치 정규화와의 호환성을 향상시키고 가중치 초기화에 대한 민감도를 감소시키기 위해.
  • 이상적인 작업들인 이미지 분류, 기계 번역, 생성 모델링에서 SRS의 실증적 유효성을 검증하기 위해.
  • SRS의 성능 향상에 기여하는 핵심 특성들—예를 들어 기울기 행동, 부드러운 비활성 범위, 유계 출력—를 분석하기 위해.

제안 방법

  • SRS는 $ f(x) = \alpha \cdot \text{sign}(x) \cdot \sqrt{\beta \cdot x^2 + \epsilon} $ 로 정의되는 비선형 활성화 함수이며, 여기서 $ \alpha $ 와 $ \beta $ 는 훈련 가능한 파rameter이다.
  • 비가역적이지 않고 부드럽고 비단조화적인 함수를 도입하여 출력이 유계임을 유지하며, ReLU의 무한대 출력과 대비된다.
  • 최소한의 수정으로 딥 러닝 프레임워크에 SRS를 통합하기 위해 고유한 신경망 레이어를 구현한다.
  • SRS의 평균과 기울기를 동적으로 조정하기 위해 $ \alpha $ 와 $ \beta $ 를 적응적으로 훈련시켜 영점 평균 출력과 개선된 기울기 흐름을 가능하게 한다.
  • SRS를 다양한 작업에 적용하여 딥 네트워크에서 성능을 평가한다. 예를 들어, 이미지 분류에는 ResNet, 기계 번역에는 Transformer, 생성 모델링에는 VAE를 사용한다.
  • Gaussian, Xavier, He 초기화와 같은 다양한 초기화 기법에서 SRS와 ReLU, 기타 비선형성 간의 추론 분석을 수행한다.

실험 결과

연구 질문

  • RQ1SRS와 같이 유계이고 부드럽고 비단조화적인 활성화 함수는 ReLU의 영점 평균이 아니며 무한대에 가까운 출력으로 인한 최적화 과제를 완화할 수 있는가?
  • RQ2SRS는 ReLU 및 기타 현대적 활성화 함수와 비교해 일반화 능력과 수렴 속도를 향상시키는가?
  • RQ3SRS는 배치 정규화와 얼마나 잘 호환되는가? 다양한 가중치 초기화 기법에 대해 얼마나 강건한가?
  • RQ4SRS의 출력 구조는 부드러움과 최적화 잠재력 측면에서 ReLU 및 기타 비선형성과 비교해 어떻게 다른가?
  • RQ5SRS의 성능 향상에 가장 기여하는 특성들은 무엇인가? 예를 들어, 유계 출력 또는 적응 가능한 파rameter 등.

주요 결과

  • Gaussian 초기화 하에서 Fashion-MNIST 데이터셋에서 SRS는 테스트 오차 12.58% 를 기록하여, ReLU(12.96%) 및 기타 기준 모델을 모두 능가했다.
  • SRS 네트워크는 은닉층에서 활성화 평균이 영점 근처에서 안정적으로 유지되며, ReLU와 달리 신속히 양수 값으로 몰리지 않는 빠른 수렴 성능을 보였다.
  • 이미지 분류(이미지 분류: CIFAR-10)에서 SRS는 ReLU 및 기타 최첨단 활성화 함수, 예를 들어 Swish와 SELU와 비교해 성능이 유사하거나 뛰어났다.
  • 기계 번역(WMT 2014 En-De)에서 SRS는 BLEU 점수에서 ReLU 및 기타 비선형성보다 뛰어난 성능을 보여, 개선된 시퀀스 모델링 능력을 입증했다.
  • 생성 모델링(이미지 분류: CIFAR-10에서 VAE)에서 SRS는 ReLU 및 ELU보다 더 높은 품질의 샘플과 더 나은 로그우도 점수를 생성했다.
  • 추론 분석을 통해 SRS는 배치 정규화와 호환되며 초기화에 덜 민감하며, 더 높은 학습률과 더 넓은 초기화 기법을 허용함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.