[논문 리뷰] The Shattered Gradients Problem: If resnets are the answer, then what is the question?
본 논문은 딥 rectifier 네트워크에서 산산조각 난 그래디언트 문제를 정의하고 분석하며, 피드포워드 넷에서 깊이가 깊어질수록 그래디언트가 백색 잡음처럼 변한다는 것을 보이고, 스킵 연결(ResNets)이 그래디언트 구조를 보존함을 보여준다; 또한 LL-init를 통해 스킵 연결 없이도 매우 깊은 넷을 학습시킬 수 있음을 제안한다.
A long-standing obstacle to progress in deep learning is the problem of vanishing and exploding gradients. Although, the problem has largely been overcome via carefully constructed initializations and batch normalization, architectures incorporating skip-connections such as highway and resnets perform much better than standard feedforward architectures despite well-chosen initialization and batch normalization. In this paper, we identify the shattered gradients problem. Specifically, we show that the correlation between gradients in standard feedforward networks decays exponentially with depth resulting in gradients that resemble white noise whereas, in contrast, the gradients in architectures with skip-connections are far more resistant to shattering, decaying sublinearly. Detailed empirical evidence is presented in support of the analysis, on both fully-connected networks and convnets. Finally, we present a new "looks linear" (LL) initialization that prevents shattering, with preliminary experiments showing the new initialization allows to train very deep networks without the addition of skip-connections.
연구 동기 및 목표
- 매우 깊은 rectifier 네트워크에서 기울기 구조를 연구하는 동기를 vanishing/exploding gradients를 넘어서 확립한다.
- 피드포워드 네트워크와 스킵 연결 구조에서 깊이에 따라 그래디언트 상관관계가 어떻게 악화되는지 특성화한다.
- 초기화 시 완전 연결 네트와 컨브넷에서의 그래디언트 구조를 경험적으로 검증한다.
- 그래디언트 산란을 완화하기 위한 초기화 및 아키텍처 전략(LL-init, 배치 정규화, β-재조정)을 제안한다.
- 그래디언트 품질의 손실 없이 스킵 연결 없이도 매우 깊은 네트워크를 학습시키기 위한 실용적 지침을 제공한다.
제안 방법
- 그래디언트 동작을 고립시키기 위해 은닉층당 200개의 rectifier 뉴런을 가진 최소 스칼라-대-스칼라 네트워크를 구성한다.
- 입력 1D 격자에 따라 그래디언트를 분석하고 깊이에 걸쳐 그래디언트 공분산 및 자기상관을 계산한다.
- feedforward 네트와 ResNet에서 그래디언트 공분산이 깊이에 따라 어떻게 감소하는지에 대한 이론적 결과(정리)를 도출한다.
- 배치 정규화와 다양한 깊이를 사용하여 CIFAR-10/실데이터에서 완전 연결 네트 및 ConvNet의 그래디언트 구조를 경험적으로 검증한다.
- looks-like-linear 초기화(LL-init)와 직교 컨볼루션 커널을 도입하고 이를 매우 깊은 네트워크에 적용해 본다.
- 스킵 연결이 있냐 없냐, 배치 정규화 및 β-재조정 여부에 따라 그래디언트 구조를 비교한다.
실험 결과
연구 질문
- RQ1표준 피드포워드 rectifier 네트워크와 잔차 네트워크에서 그래디언트의 상관 구조가 깊이에 따라 어떻게 달라지는가?
- RQ2스킵 연결(ResNets)이 초기화 시점과 초기 학습 기간 동안 그래디언트 구조를 보존하고 산란을 방지하는가?
- RQ3배치 정규화와 β-재조정은 깊은 네트의 그래디언트 상관 구조에 어떤 역할을 하는가?
- RQ4산란을 피하는 초기화 전략(LL-init)이 스킵 연결 없이도 매우 깊은 네트워크를 학습시킬 수 있는가?
- RQ5관찰된 그래디언트 현상이 완전 연결 네트에서 컨브넷으로 확장되어 실제 데이터셋에서도 나타나는가?
주요 결과
- 깊은 피드포워드 rectifier 네트워크에서 그래디언트는 깊이가 증가할수록 백색 잡음처럼 보이며, 그래디언트 상관은 깊이에 따라 지수적으로 감소한다.
- ResNet의 스킵 연결은 그래디언트를 더느리게 화이트닝하여 구조를 보존하고, 매우 깊은 네트워크의 학습 가능성을 크게 높인다.
- 배치 정규화는 그래디언트 구조를 변화시킨다: 노드를 활성화 상태로 유지하고 공간적 활성화 패턴을 제어하여 그래디언트 상관에 영향을 준다.
- ResNet의 β-재조정(β가 [0.1,0.3]일 때)은 그래디언트 화이트닝을 더 억제하고 깊이에 따른 그래디언트 상관의 감소를 느리게 한다.
- LL-init은 스킵 연결 없이도 매우 깊은 네트워크를 학습 가능하게 하며, CIFAR-10 실험에서 ResNet과 비슷한 성능을 달성한다.
- CIFAR-10과 ConvNet에 대한 실험은 ResNet에서 그래디언트 화이트닝이 완화되며 LL-init와 직교 커널이 깊은 네트의 학습을 가능하게 함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.