[논문 리뷰] Demystifying ResNet
이 논문은 짧은 연결(shortcut) 길이가 2인 잔차 신경망(ResNets)이 다른 짧은 연결 깊이보다 성능이 뛰어나지 않는 이유를 이론적으로 설명한다. 짧은 연결 길이가 2일 경우 초기화 시 헤시안 행렬의 조건수(condition number)가 깊이에 관계없이 일정해져 매우 깊은 네트워크의 안정적 훈련을 가능하게 하며, 다른 깊이에서는 악조건화되거나 고차수의 안장점(saddle point)이 발생해 최적화를 방해함을 보여준다.
The Residual Network (ResNet), proposed in He et al. (2015), utilized shortcut connections to significantly reduce the difficulty of training, which resulted in great performance boosts in terms of both training and generalization error. It was empirically observed in He et al. (2015) that stacking more layers of residual blocks with shortcut 2 results in smaller training error, while it is not true for shortcut of length 1 or 3. We provide a theoretical explanation for the uniqueness of shortcut 2. We show that with or without nonlinearities, by adding shortcuts that have depth two, the condition number of the Hessian of the loss function at the zero initial point is depth-invariant, which makes training very deep models no more difficult than shallow ones. Shortcuts of higher depth result in an extremely flat (high-order) stationary point initially, from which the optimization algorithm is hard to escape. The shortcut 1, however, is essentially equivalent to no shortcuts, which has a condition number exploding to infinity as the number of layers grows. We further argue that as the number of layers tends to infinity, it suffices to only look at the loss function at the zero initial point. Extensive experiments are provided accompanying our theoretical results. We show that initializing the network to small weights with shortcut 2 achieves significantly better results than random Gaussian (Xavier) initialization, orthogonal initialization, and shortcuts of deeper depth, from various perspectives ranging from final loss, learning dynamics and stability, to the behavior of the Hessian along the learning process.
연구 동기 및 목표
- 짧은 연결 길이가 2인 ResNets가 왜 매우 깊은 네트워크의 훈련을 유일하게 가능하게 하는지 설명하는 것. 이는 다른 짧은 연결 깊이(1 또는 3)가 동일한 이점을 제공하지 않는다는 경험적 관찰과 모순되지 않는다.
- 다양한 짧은 연결 깊이를 가진 깊은 잔차 신경망의 초기화 지점에서 최적화 지형을 분석하며, 특히 헤시안 행렬의 조건수와 짧은 연결 깊이 간의 의존성에 중점을 둔다.
- 짧은 연결 길이가 2일 경우 악조건화되거나 고차수의 안장점이 발생하는 것을 방지함을 보여주며, 짧은 연결 길이가 1인 경우 조건수가 급격히 증가하는 선형 네트워크와 유사한 성질을 띤다.
- 다양한 초기화 방법과 짧은 연결 깊이에서의 훈련 동역학, 손실 수렴, 헤시안 행동을 비교하는 광범위한 실험을 통해 이론적으로 유도된 통찰을 검증하는 것.
제안 방법
- 다양한 짧은 연결 깊이를 가진 깊은 잔차 신경망에 대해 손실 함수의 헤시안을 초기화 지점에서 이론적으로 분석한다.
- 짧은 연결 길이가 2일 경우 헤시안의 조건수가 유한하게 유지됨(깊이에 관계없음)을 보여주는 유도를 수행하며, 짧은 연결 길이가 1일 경우 깊이에 비례해 조건수가 무한히 증가함을 증명한다.
- 짧은 연결 길이가 2를 초과할 경우, 초기화 지점에서 고차수의 안장점이 발생함(헤시안 행렬이 영행렬)을 증명한다. 이는 최적화 과정에서 탈출하기 어려움을 의미한다.
- MNIST 및 CIFAR-10 데이터셋을 대상으로 선형 및 비선형 ResNet 아키텍처를 사용하여 훈련 동역학, 최종 손실, 헤시안 고유값 행동을 비교하는 실험을 수행한다.
- 선형 보간을 사용해 훈련 경로 상의 다양한 손실 수준에서 고유값 통계(최대값, 10번째 백분위수, 음수 고유값 비율)를 계산한다.
- 초기화 방법을 비교: 랜덤 가우시안(Xavier), 직교(initialization), 그리고 짧은 연결 길이가 2인 경우의 영초기화를 사용하며, 깊이와 파라미터 수를 동일하게 유지한다.
실험 결과
연구 질문
- RQ1왜 ResNets에서 짧은 연결 길이가 2일 때만 매우 깊은 네트워크의 훈련이 가능하며, 길이가 1 또는 3인 경우는 그렇지 않은가?
- RQ2깊은 잔차 신경망에서 짧은 연결 깊이에 따라 초기화 지점에서 헤시안의 조건수가 어떻게 변하는가?
- RQ3다양한 짧은 연결 깊이에 대해 초기화 지점의 임계점의 성격은 무엇이며, 최적화 동역학에 어떤 영향을 미치는가?
- RQ4깊이에 관계없이 짧은 연결 길이가 2인 영초기화가 Xavier 또는 직교 초기화보다 훈련 안정성과 수렴 속도 측면에서 뛰어나다는가?
- RQ5훈련 과정에서 다양한 짧은 연결 깊이에 따라 헤시안 고유값 분포와 음의 곡률 행동은 어떻게 다름?
주요 결과
- 짧은 연결 길이가 2일 경우, 초기화 시 헤시안의 조건수가 깊이에 관계없이 일정해져 임의로 깊은 네트워크의 안정적 훈련이 가능하다.
- 짧은 연결 길이가 1일 경우, 조건수가 깊이에 비례해 무한히 증가하여 최적화가 점점 어려워진다.
- 짧은 연결 길이가 2를 초과할 경우, 초기화 지점에서 고차수의 안장점이 발생함(헤시안 행렬이 영행렬), 이는 최적화 과정에서 탈출하기 어려움을 의미한다.
- 실험 결과, 작은 가중치로 초기화(영초기화)하고 짧은 연결 길이가 2인 경우, 특히 깊은 네트워크에서 Xavier나 직교 초기화보다 훨씬 우수한 최종 손실을 달성한다.
- 2-짧은 연결 네트워크는 더 빠른 학습 동역학과 낮은 음수 고유값 비율을 보이며, 낮은 손실의 임계점으로 수렴하는 경향이 있음.
- CIFAR-10에서 짧은 연결 길이가 2인 ResNets만 400층을 초과해 깊이가 증가함에 따라 성능 향상을 보이며, 나머지는 성능이 악화됨.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.