[논문 리뷰] Layer Normalization
레이어 정규화를 도입하여 각 계층 내의 합산 입력을 정규화함으로써 RNN을 포함한 다양한 신경망의 학습을 안정화하고 가속화한다. 미니배치가 아닌 각 레이어 내에서 정규화한다.
Training state-of-the-art, deep neural networks is computationally expensive. One way to reduce the training time is to normalize the activities of the neurons. A recently introduced technique called batch normalization uses the distribution of the summed input to a neuron over a mini-batch of training cases to compute a mean and variance which are then used to normalize the summed input to that neuron on each training case. This significantly reduces the training time in feed-forward neural networks. However, the effect of batch normalization is dependent on the mini-batch size and it is not obvious how to apply it to recurrent neural networks. In this paper, we transpose batch normalization into layer normalization by computing the mean and variance used for normalization from all of the summed inputs to the neurons in a layer on a single training case. Like batch normalization, we also give each neuron its own adaptive bias and gain which are applied after the normalization but before the non-linearity. Unlike batch normalization, layer normalization performs exactly the same computation at training and test times. It is also straightforward to apply to recurrent neural networks by computing the normalization statistics separately at each time step. Layer normalization is very effective at stabilizing the hidden state dynamics in recurrent networks. Empirically, we show that layer normalization can substantially reduce the training time compared with previously published techniques.
연구 동기 및 목표
- 정규화를 통해 심층 네트의 학습 시간을 단축시키려는 동기를 부여한다.
- 온라인에서도 작동하고 RNN에 작용하는 배치 정규화의 대안으로 레이어 정규화를 제안한다.
- 정규화 하에서의 불변성 특성과 학습 역학을 분석한다.
- 여러 작업 및 아키텍처에 걸쳐 레이어 정규화를 실험적으로 검증한다.
제안 방법
- 정규화를 위해 은닉 유닛에 걸친 계층당 평균과 분산을 계산한다.
- 비선형 활성화 함수 이전에 정규화 후에 적응 이득과 바이어스를 적용한다.
- RNN의 경우 현재 계층의 통계치를 사용하여 매 시간 스텝에서 정규화한다 (Eq. 4).
- 배치 정규화 및 가중치 정규화와의 불변성 특성을 비교한다 (Section 5).
- Fisher 정보(fisher information)를 사용한 이론적 분석을 제공하여 암시적 학습률 효과를 논의한다.
- 이미지-문장 순위, QA, 언어 모델링, skip-thoughts, 필기, MNIST 및 CNN에 대해 실험적으로 평가한다.
실험 결과
연구 질문
- RQ1레이어 정규화가 다양한 아키텍처(RNN, CNN, DRAW)와 작업에서 학습 속도와 일반화 향상을 가져오는가?
- RQ2레이어 정규화에서의 불변성 특성과 학습 역학이 배치 정규화 및 가중치 정규화와 어떻게 비교되는가?
- RQ3시간 스텝별 통계 없이도 RNN에서 온라인 학습과 긴 시퀀스 학습을 가능하게 하는가?
- RQ4긴 시퀀스와 작은 미니배치에서 레이어 정규화의 실증적 영향은 무엇인가?
주요 결과
- 레이어 정규화는 다수 작업에서 학습 속도를 높이고 일반화를 향상시키며, 특히 순환 네트워크 및 긴 시퀀스에서 그렇다.
- 레이어 정규화는 학습 사례별 특성의 이동 및 재스케일링에 불변하고, 미니배치 크기에 의존하지 않는다.
- 계층 내에서 합산 입력을 재평균화하고 재스케일링하여( Eq. 3 및 Eq. 4 ) 안정적인 은닉 상태 다이나믹을 제공한다.
- 실험에서 이미지-문장 순위, QA, skip-thoughts, DRAW, 필기 및 순열-불변 MNIST와 같은 작업에서 더 빠른 수렴과 더 나은 검증 성능을 보인다.
- 레이어 정규화는 순환 모델에서 초기 이득 스케일에 대한 감도가 순환 배치 정규화에 비해 낮다.
- CNN에서 레이어 정규화는 기준 대비 속도를 높이지만 일부 상황에서는 배치 정규화가 더 우수할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.