[논문 리뷰] The effect of Target Normalization and Momentum on Dying ReLU
이 논문은 깊이 있는 신경망에서 히든 레이어의 ReLU 유닛이 학습 도중 사라지는 이유를 분석한다. 특히 타겟 정규화와 모멘텀 최적화 하에서 발생하는 현상에 초점을 맞추고 있다. 연구는 낮은 타겟 분산과 모멘텀이 최적화 궤적을 불안정하게 만들어 사라지는 ReLU의 위험을 증가시킨다는 점을 보이며, 잔차 신경망과 같은 더 깊은 아키텍처에서 이 문제가 악화됨을 경험적으로 확인한다.
Optimizing parameters with momentum, normalizing data values, and using rectified linear units (ReLUs) are popular choices in neural network (NN) regression. Although ReLUs are popular, they can collapse to a constant function and "die", effectively removing their contribution from the model. While some mitigations are known, the underlying reasons of ReLUs dying during optimization are currently poorly understood. In this paper, we consider the effects of target normalization and momentum on dying ReLUs. We find empirically that unit variance targets are well motivated and that ReLUs die more easily, when target variance approaches zero. To further investigate this matter, we analyze a discrete-time linear autonomous system, and show theoretically how this relates to a model with a single ReLU and how common properties can result in dying ReLU. We also analyze the gradients of a single-ReLU model to identify saddle points and regions corresponding to dying ReLU and how parameters evolve into these regions when momentum is used. Finally, we show empirically that this problem persist, and is aggravated, for deeper models including residual networks.
연구 동기 및 목표
- 모멘텀과 타겟 정규화 하에서 ReLU 유닛이 학습 도중 사라지는 이유를 이해하는 것.
- 단일 ReLU 모델에서 타겟 분산, 모멘텀, 그리고 매개변수 동역학 간의 상호작용을 분석하는 것.
- 잔차 신경망과 배치 정규화를 포함한 더 깊은 아키텍처에서 사라지는 ReLU 문제가 지속되는지 조사하는 것.
- 다양한 타겟 스케일에서 매개변수 재스케일링이 사라지는 ReLU 문제를 완화할 수 있는지 확인하는 것.
- 매개변수 공간에서 사라진 ReLU 영역을 식별하기 위한 기하학적 및 분석적 프레임워크를 제공하는 것.
제안 방법
- 모멘텀을 사용한 경사 하강법를 이산 시간 선형 동차 시스템으로 모델링하여 매개변수 동역학을 분석하는 것.
- 단일 ReLU 선형 모델의 해석적 기울기를 유도하여 임계점(전역 최적점 및 안장점 포함)을 식별하는 것.
- 매개변수 공간에 두 개의 원뿔을 기하학적으로 정의하는 것: 하나는 활성 ReLU에 대응하고, 다른 하나는 사라진 ReLU에 대응하는 것.
- 다양한 타겟 분산과 모멘텀 조건에서 매개변수 궤적과 수렴 행동을 시각화하기 위해 수치 시뮬레이션을 수행하는 것.
- 다양한 타겟 분산을 가진 더 깊은 아키텍처(MLP 및 잔차 신경망)를 경험적으로 평가하여 사라지는 ReLU 빈도를 분석하는 것.
- 매개변수 재스케일링 전략을 테스트하여 타겟 스케일에 대한 불변성과 깊은 네트워크에서의 한계를 확인하는 것.
실험 결과
연구 질문
- RQ1타겟 분산이 모멘텀 최적화 하에서 ReLU 유닛이 사라지는 데 영향을 미치는 정도는 어떻게 되는가?
- RQ2모멘텀이 매개변수 궤적을 불안정하게 만들고 사라진 ReLU 상태로의 수렴을 촉진하는 데 어떤 역할을 하는가?
- RQ3단일 ReLU의 동역학을 선형 시스템으로 모델링할 수 있으며, 이는 사라진 ReLU의 발생과 어떻게 관련되는가?
- RQ4잔차 신경망과 배치 정규화를 포함한 더 깊은 아키텍처에서도 사라지는 ReLU 문제는 지속되고 악화되는가?
- RQ5타겟 분산을 보상하기 위해 가중치와 편향을 재스케일링함으로써 스케일 불변 학습을 달성할 수 있는가?
주요 결과
- 단위 분산 타겟은 타당한 선택이다. 타겟 분산이 감소할수록 특히 모멘텀을 사용할 경우 ReLU 유닛이 더 쉽게 사라진다.
- 모멘텀이 있을 경우 선형 시스템의 복소 고유값으로 인해 매개변수 궤적이 진동하게 되어 사라진 ReLU 원뿔로 수렴할 위험이 증가한다.
- 경험적 결과로, 타겟 분산이 작을 경우(γ = 0.001), 모멘텀이 표준 경사 하강법에 비해 사라지는 ReLU 유닛의 비율을 크게 증가시킨다.
- 잔차 신경망과 배치 정규화를 포함한 더 깊은 모델에서도 사라지는 ReLU 문제는 여전히 존재하며, 깊이가 증가할수록 더욱 악화된다.
- 매개변수 재스케일링은 깊은 네트워크에서 사라지는 ReLU 문제를 완전히 제거하지 못한다. 다중 레이어를 거치며 기능적 등가성이 깨지기 때문이다.
- 타겟 분산이 감소하고 모멘텀이 증가할수록 사라진 ReLU로 이어지는 매개변수 공간 영역이 확장되며, 특히 β > 0.7일 경우 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.