[논문 리뷰] Why ResNet Works? Residuals Generalize
이 논문은 복잡한 아키텍처를 지닌 잔차 연결(ResNets)이 왜 잘 일반화되는지에 대한 이론적 분석을 제공한다. 잔차 연결은 총 가중치 수와 비선형성 수가 고정되어 있을 때 체인 구조의 네트워크와 비교해 가설 공간의 복잡도를 증가시키지 않는다는 것을 보여준다. 주요 기여는 ResNet에 대해 $\mathcal{O}(1/\sqrt{N})$ 순서의 일반화 경계를 도출한 것으로, 이 경계는 가중치 행렬의 노름 곱에 의존하며, 가중치 감쇠(weight decay)를 정규화 기법으로 사용하는 데 이론적 근거를 제공한다.
Residual connections significantly boost the performance of deep neural networks. However, there are few theoretical results that address the influence of residuals on the hypothesis complexity and the generalization ability of deep neural networks. This paper studies the influence of residual connections on the hypothesis complexity of the neural network in terms of the covering number of its hypothesis space. We prove that the upper bound of the covering number is the same as chain-like neural networks, if the total numbers of the weight matrices and nonlinearities are fixed, no matter whether they are in the residuals or not. This result demonstrates that residual connections may not increase the hypothesis complexity of the neural network compared with the chain-like counterpart. Based on the upper bound of the covering number, we then obtain an $\mathcal O(1 / \sqrt{N})$ margin-based multi-class generalization bound for ResNet, as an exemplary case of any deep neural network with residual connections. Generalization guarantees for similar state-of-the-art neural network architectures, such as DenseNet and ResNeXt, are straight-forward. From our generalization bound, a practical implementation is summarized: to approach a good generalization ability, we need to use regularization terms to control the magnitude of the norms of weight matrices not to increase too much, which justifies the standard technique of weight decay.
연구 동기 및 목표
- 깊이 있는 신경망에서 잔차 연결이 모델 복잡도 증가 가능성에도 불구하고 좋은 일반화를 이끌어내는 이유를 이해하기 위해.
- 커버링 수를 이용해 잔차 연결이 가설 공간 복잡도에 미치는 영향을 분석하기 위해.
- 커버링 수와 가중치 노름 곱에 기반한 ResNet의 일반화 경계를 유도하기 위해.
- 광범위하게 사용되는 가중치 감쇠 정규화 기법에 대한 이론적 근거를 제공하기 위해.
- DenseNet과 ResNeXt와 같은 다른 잔차 기반 아키텍처로 일반화 분석을 확장하기 위해.
제안 방법
- 저자들은 깊이 있는 신경망에 잔차 연결을 모델링하기 위해 스템-비네 프레임워크를 정의하여 주 체인(스템)과 잔차 스킵 연결을 분리한다.
- 가설 공간의 커버링 수에 대한 상한을 도출하여, 총 가중치 수와 비선형성 수가 고정되어 있을 경우, 가중치 행렬이 스템에 있든 잔차에 있든 커버링 수가 변하지 않음을 보여준다.
- 표준 통계학적 학습 이론 기법을 통해 커버링 수 상한을 이용해 라데마처 복잡도 상한을 도출한다.
- ResNet에 대해 $\mathcal{O}(1/\sqrt{N})$ 순서의 마진 기반 다중 클래스 일반화 경계를 확립한다. 여기서 $N$은 훈련 샘플 수이다.
- 일반화 경계는 모든 가중치 행렬의 $L_2$ 노름 곱에 의존하며, 이는 이 곱을 제어하면 일반화 성능이 향상됨을 시사한다.
- 동일한 커버링 수와 일반화 경계 원리에 기반해 이론적 프레임워크를 DenseNet과 ResNeXt와 같은 다른 잔차 아키텍처로 확장한다.
실험 결과
연구 질문
- RQ1잔차 연결의 추가가 깊이 있는 신경망의 가설 공간 복잡도를 증가시키는가?
- RQ2동일한 파라미터 수를 가진 체인 구조의 깊이 있는 네트워크와 비교해 ResNet의 가설 공간 커버링 수는 어떻게 되는가?
- RQ3ResNet에 대해 그 강력한 일반화 성능을 설명할 수 있는 일반화 경계를 도출할 수 있는가?
- RQ4가중치 행렬의 노름이 잔차 네트워크의 일반화 오차에 어떤 역할을 하는가?
- RQ5제안된 이론은 가중치 감쇠가 깊이 있는 잔차 네트워크 훈련에서 효과적인 이유를 어떻게 정당화하는가?
주요 결과
- 총 가중치 행렬 수와 비선형성 수가 고정되어 있을 경우, 잔차 네트워크의 가설 공간 커버링 수는 해당하는 체인 구조 네트워크와 동일한 값으로 상한이 둔다.
- 잔차 연결은 가설 공간 복잡도를 증가시키지 않으며, 이는 스킵 연결이 모델 용량을 증가시킨다는 직관과 반대된다.
- ResNet에 대해 $\mathcal{O}(1/\sqrt{N})$ 순서의 일반화 경계가 도출되었으며, 여기서 $N$은 훈련 샘플 수이다.
- 일반화 경계는 모든 가중치 행렬의 $L_2$ 노름 곱에 의존하며, 이는 더 큰 노름이 악화된 일반화를 초래함을 시사한다.
- 이론적 분석은 가중치 감쇠를 정규화 기법으로 사용하는 데 이론적 근거를 제공한다. 왜냐하면 가중치 행렬의 노름을 제어함으로써 일반화 성능을 향상시킬 수 있기 때문이다.
- 일반화 경계는 DensNet과 ResNeXt와 같은 다른 잔차 아키텍처로 최소한의 수정으로도 확장 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.