Skip to main content
QUICK REVIEW

[논문 리뷰] On Random Kernels of Residual Architectures

Etai Littwin, Tomer Galanti|arXiv (Cornell University)|2020. 01. 28.
Advanced Neural Network Applications참고 문헌 17인용 수 4
한 줄 요약

이 논문은 잔차(ResNet) 및 밀집 연결(DenseNet) 아키텍처에서 신경 탄성 커널(NTK)의 유한한 너비 및 깊이 보정을 유도하며, 적절한 초기화 하에 너비와 깊이가 동시에 증가할 경우 이러한 네트워크가 무한 너비 NTK 영역로 수렴함을 보여준다. 바닐라 네트워크와는 달리, ResNets와 DenseNets는 최소한의 파라미터 복잡도—각각 O(L) 및 O(L²)로—유한한 크기에서도 NTK 분산이 유한해지며, 이는 무작위 경사하강 특징을 사용한 효과적인 커널 회귀를 가능하게 한다.

ABSTRACT

We derive finite width and depth corrections for the Neural Tangent Kernel (NTK) of ResNets and DenseNets. Our analysis reveals that finite size residual architectures are initialized much closer to the "kernel regime" than their vanilla counterparts: while in networks that do not use skip connections, convergence to the NTK requires one to fix the depth, while increasing the layers' width. Our findings show that in ResNets, convergence to the NTK may occur when depth and width simultaneously tend to infinity, provided with a proper initialization. In DenseNets, however, convergence of the NTK to its limit as the width tends to infinity is guaranteed, at a rate that is independent of both the depth and scale of the weights. Our experiments validate the theoretical results and demonstrate the advantage of deep ResNets and DenseNets for kernel regression with random gradient features.

연구 동기 및 목표

  • 잔차 연결과 밀접한 연결이 유한 너비, 유한 깊이 네트워크에서 신경 탄성 커널(NTK)의 무한 너비 근사로의 수렴에 어떻게 영향을 미치는지 이해한다.
  • 바닐라 완전 연결 네트워크의 한계를 다루며, NTK 영역으로의 수렴을 위해 너비를 깊이에 따라 스케일링해야 하는 데서 비롯되는 높은 파라미터 복잡도 문제를 해결한다.
  • 잔차 및 밀집 아키텍처의 NTK 수렴 속도를 특성화하며, 특히 대각선 항과 비대각선 항에 중점을 둔다.
  • 무작위 경사하강 특징을 사용한 MNIST 및 소규모 UCI 데이터셋에서의 경험적 실험을 통해 이론적으로 유도된 수렴 속도를 검증한다.
  • 깊은 ResNets와 DenseNets가 고정 너비에서도 바닐라 아키텍처보다 커널 회귀 성능에서 뛰어나지 않음에도 불구하고, 깊이에 따라 NTK 안정성이 향상되어 성능이 향상됨을 보여준다.

제안 방법

  • ReLU 전방전파-역전파 노름 전파 이중성의 개념을 도입하여, NTK 항의 분산을 분석한다.
  • 층별 활성화 및 기울기의 재귀적 분석을 통해 ResNets와 DenseNets의 NTK에 대한 유한 너비 및 깊이 보정을 유도한다.
  • 모멘트 기반 분석을 사용하여 기대 제곱 NTK 값과 그 분산을 계산하며, 대각선 항에 대해 E[G(x,x)] 및 E[G(x,x)²]에 집중한다.
  • 너비 n과 깊이 L을 고려하여 E[G(x,x)²]/E[G(x,x)]²에 대한 상한 및 하한을 이용해 정규화된 NTK 분산의 경계를 설정한다.
  • 바닐라 ReLU 네트워크의 결과를 기반 사례로 삼고, 스킵 연결의 재귀적 분해를 통해 잔차 및 밀집 아키텍처로 확장한다.
  • MNIST 및 UCI 데이터셋에서 랜덤 경사하강 특징 G(x;w)를 커널 근사로 사용하여 커널 회귀 성능을 경험적으로 평가한다.

실험 결과

연구 질문

  • RQ1잔차 및 밀집 아키텍처에서 NTK의 무한 너비 근사로의 수렴 속도는 너비와 깊이에 어떻게 의존하는가?
  • RQ2바닐라 네트워크와 달리, 너비와 깊이가 동시에 증가할 때 ResNets와 DenseNets가 NTK 수렴을 달성할 수 있는가?
  • RQ3유한한 ResNets와 DenseNets가 바닐라 네트워크와 비교해 유한한 NTK 분산을 유지하기 위해 필요한 파라미터 복잡도는 얼마인가?
  • RQ4ResNets와 DenseNets에서 깊이에 따라 랜덤 경사하강 특징을 사용한 커널 회귀 성능은 어떻게 변화하는가? 바닐라 아키텍처와 비교해보라.
  • RQ5잔차 및 밀집 네트워크에서 전체 NTK 행렬의 공동 분포 행동은 어떻게 되며, 대각선 항만 고려한 분석과 비교해보면 어떠한가?

주요 결과

  • ResNets의 경우, 적절한 초기화 하에 너비와 깊이가 동시에 무한으로 갈 때 NTK 근사로 수렴하며, 파라미터 복잡도가 O(L)로 매우 낮아진다.
  • DenseNets의 경우, 너비가 증가함에 따라 NTK가 무한 너비 근사로 수렴하며, 수렴 속도는 깊이 및 가중치 스케일에 영향을 받지 않는다.
  • ResNets의 대각선 NTK 항 G(x,x)의 정규화된 분산은 exp(5m/n + C/n ∑ αl/(1+αl))로 표현되며, 너비와 깊이가 함께 증가할 경우 유한하게 유지된다.
  • DenseNets의 경우, 정규화된 분산은 max{1, 1/(L log²L) · exp(C/n)}로 경계지어지며, 이는 고정 너비에서도 깊이를 늘일수록 커널 근사 품질이 향상됨을 보여준다.
  • 경험적 결과로, 고정 너비의 ResNets와 DenseNets에서 무작위 경사하강 특징을 사용한 커널 회귀 성능은 깊이가 증가함에 따라 향상되며, 이는 바닐라 네트워크의 성능 저하와는 대조된다.
  • MNIST 및 소규모 UCI 데이터셋에서 NTK 분산에 대한 이론적 경계가 경험적으로 검증되었으며, 깊은 잔차 및 밀집 아키텍처가 유한 크기에서도 안정적인 NTK 행동을 유지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.