Skip to main content
QUICK REVIEW

[논문 리뷰] Symmetrical Gaussian Error Linear Units (SGELUs)

Chao Yu, Zhiguo Su|arXiv (Cornell University)|2019. 11. 10.
Numerical Methods and Algorithms참고 문헌 11인용 수 4
한 줄 요약

이 논문은 기울기 소실 문제를 완화하고 이중 최적화를 가능하게 하기 위해 대칭성과 GELU의 확률적 정규화를 결합한 새로운 활성화 함수인 대칭형 가우시안 오차 선형 유닛(SGELU)을 제안한다. MNIST 분류 및 오토인코딩 작업에서 GELU와 LiSHT보다 뛰어난 수렴성과 정확도를 달성하며, 효율적인 최소-최대 정규화를 통해 배치 정규화의 필요성을 감소시키고 가중치 분포를 개선한다.

ABSTRACT

In this paper, a novel neural network activation function, called Symmetrical Gaussian Error Linear Unit (SGELU), is proposed to obtain high performance. It is achieved by effectively integrating the property of the stochastic regularizer in the Gaussian Error Linear Unit (GELU) with the symmetrical characteristics. Combining with these two merits, the proposed unit introduces the capability of the bidirection convergence to successfully optimize the network without the gradient diminishing problem. The evaluations of SGELU against GELU and Linearly Scaled Hyperbolic Tangent (LiSHT) have been carried out on MNIST classification and MNIST auto-encoder, which provide great validations in terms of the performance, the convergence rate among these applications.

연구 동기 및 목표

  • 깊은 신경망에서 기울기 소실 문제를 해결하기 위해 대칭성 특성을 갖춘 활성화 함수를 개선한다.
  • GELU의 확률적 정규화와 대칭 출력 행동을 통합하여 모델 성능을 향상시킨다.
  • 경량 정규화 기법과 호환되는 활성화 함수를 설계하여 배치 정규화에 대한 의존도를 줄인다.
  • MNIST 분류 및 오토인코딩 작업에서 SGELU가 GELU와 LiSHT보다 뛰어난 성능을 보임을 검증한다.

제안 방법

  • SGELU를 GELU의 대칭형 변형으로 제안하며, 공식 $ SGELU(x) = \alpha x \cdot \mathrm{erf}\left(\frac{x}{\sqrt{2}}\right) $ 를 사용한다. 여기서 $ \alpha $ 는 학습 가능한 초매개변수이다.
  • SGELU 출력 후 적용되는 최소-최대 정규화 기법을 도입하여 학습을 안정화시키며, 배치 정규화를 대체한다.
  • 사슬 법칙을 활용해 기울기와 가중치 갱신을 유도하고, 음수 입력에 대해서도 비영 기울기를 유지함을 보여준다.
  • 코모고로프-스미르노프 검정을 사용하여 SGELU 가중치가 정규 분포를 따름을 검증함으로써 모델의 강건성을 향상시킨다.
  • MNIST 분류 및 오토인코더 벤치마크를 활용해 ReLU, ELU, GELU, LiSHT, SGELU 간의 학습 동역학과 손실 수렴성을 비교한다.
  • SGELU가 음영 영역에서 희소성이 없는 활성화를 보이며, 이로 인해 드롭아웃과의 호환성이 떨어짐을 분석한다.

실험 결과

연구 질문

  • RQ1GELU와 LiSHT와 비교해 대칭 활성화 함수가 깊은 신경망에서 기울기 흐름과 수렴성에 미치는 영향은 어떠한가?
  • RQ2SGELU에 통합된 확률적 정규화와 대칭성은 가중치 분포와 모델 일반화에 어떤 영향을 미치는가?
  • RQ3SGELU는 배치 정규화의 필요성을 줄이는가? 만약 그렇다면, 유사하거나 더 나은 성능을 달성할 수 있는 대체 정규화 기법은 무엇인가?
  • RQ4SGELU는 왜 드롭아웃과 잘 맞지 않는가? 이 경우에서 ReLU와 GELU와의 활성화 행동은 어떻게 다를까?
  • RQ5MNIST 분류 및 오토인코딩 작업에서 SGELU는 정확도와 수렴 속도 측면에서 GELU와 LiSHT를 얼마나 뛰어나게 하는가?

주요 결과

  • MNIST 분류 작업에서 SGELU는 GELU와 LiSHT보다 더 빠른 수렴성과 높은 테스트 정확도를 달성했으며, 학습 및 테스트 손실이 더 매끄럽게 감소했다.
  • MNIST 오토인코딩에서 SGELU는 다섯 번의 실행 동안 학습 및 테스트 중앙값 결과에서 GELU와 LiSHT를 모두 능가했다.
  • SGELU 네트워크의 가중치는 여덟 개의 은닉층 중 일곱 개에서 코모고로프-스미르노프 정규성 검정에 통과했으며, GELU는 오직 두 개에 불과해 더 나은 가중치 분포를 보였다.
  • 배치 정규화 없이도 SGELU는 최소-최대 정규화를 사용해 GELU와 유사하거나 더 높은 정확도를 달성했으며, 이는 계산 비용이 낮은 방법이다.
  • SGELU 후에 최소-최대 정규화를 적용함으로써 배치 정규화보다 계산 복잡도가 낮아 훈련 시간을 크게 단축시켰다.
  • SGELU는 음수 영역에서 비영 활성화를 보이며, 이로 인해 뉴런의 희소성이 떨어져 드롭아웃과의 호환성이 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.