[논문 리뷰] Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit
이 논문은 잔차 연결에 대한 새로운 매개변수화 방식을 제안한다—$μ$P 초기화와 잔차 브랜치의 $1/\sqrt{\text{depth}}$ 스케일링을 조합함으로써 넓이와 깊이를 초월해 최적의 초매개변수(예: 학습률, 모멘터, 가중치 감쇠)를 이전할 수 있도록 한다. 이 방법은 동적 평균장 이론(DMFT)을 통해 무한 넓이 및 무한 깊이 근사에서 안정적인 학습 역학을 달성하며, CIFAR-10, ImageNet 및 비전 트랜스포머에서 이론적·실험적으로 초매개변수 이전이 강건하게 성립함을 보여준다.
The cost of hyperparameter tuning in deep learning has been rising with model sizes, prompting practitioners to find new tuning methods using a proxy of smaller networks. One such proposal uses $μ$P parameterized networks, where the optimal hyperparameters for small width networks transfer to networks with arbitrarily large width. However, in this scheme, hyperparameters do not transfer across depths. As a remedy, we study residual networks with a residual branch scale of $1/\sqrt{ ext{depth}}$ in combination with the $μ$P parameterization. We provide experiments demonstrating that residual architectures including convolutional ResNets and Vision Transformers trained with this parameterization exhibit transfer of optimal hyperparameters across width and depth on CIFAR-10 and ImageNet. Furthermore, our empirical findings are supported and motivated by theory. Using recent developments in the dynamical mean field theory (DMFT) description of neural network learning dynamics, we show that this parameterization of ResNets admits a well-defined feature learning joint infinite-width and infinite-depth limit and show convergence of finite-size network dynamics towards this limit.
연구 동기 및 목표
- 대규모 딥 네트워크에서 초매개변수 튜닝의 비용 증가 문제를 해결하기 위해 넓이와 깊이를 초월해 최적의 초매개변수를 이전할 수 있도록 하는 것.
- 기존 $\mu$P 매개변수화 방식의 한계를 극복하기 위해, 잔차 네트워크에서 깊이를 초월해 초매개변수를 이전하지 못하는 문제를 해결하는 것.
- 동적 평균장 이론(DMFT)을 활용해 넓고 깊은 잔차 네트워크에서 크기와 무관한 안정적인 학습 역학에 대한 이론적 기반을 확립하는 것.
- 실험적으로 제안된 매개변수화 방식이 합성곱 ResNets와 비전 트랜스포머에서 일관된 초매개변수 이전을 가능하게 함을 검증하는 것.
- 네트워크의 무한 넓이 및 무한 깊이 근사에서의 동역학을 특성화하고, 잘 정의된 스케일링 근사로 수렴함을 보여주는 것.
제안 방법
- 잔차 브랜치의 가중치를 $1/\sqrt{\text{depth}}$로 스케일링하여 깊이에 걸쳐 특성 학습 역학을 안정화하는 수정된 $\mu$P 매개변수화를 도입한다.
- 무한 넓이 및 무한 깊이 근사에서 네트워크의 동역학을 분석하기 위해 동적 평균장 이론(DMFT)을 적용하며, 층 인덱스를 연속적인 '층 시간'으로 간주한다.
- 특성 진동의 연속 시간 스토케스틱 미분 방정식(SDE)을 유도하여, 특성 및 예측 업데이트가 네트워크의 넓이와 깊이에 독립적으로 스케일링되도록 보장한다.
- 통합 인자와 연속 시간 근사 기법을 사용해 가중치 감쇠 동역학을 모델링하며, 초기 조건의 영향이 시간이 지남에 따라 지수적으로 감소함을 보여준다.
- 깊이 스케일링이 학습 동역학과 초매개변수 이전에 미치는 영향을 분리하기 위해, 읽기 출력 가중치를 0으로 초기화한 다층 블록 아키텍처를 사용한다.
- 고정된 학습률과 복잡한 스케줄링을 사용해 CIFAR-10, Tiny ImageNet, ImageNet 및 비전 트랜스포머에서 광범위한 실험을 수행해 결과를 검증한다.

실험 결과
연구 질문
- RQ1잔차 네트워크에서 최적의 초매개변수(예: 학습률)가 넓이와 깊이를 초월해 이전될 수 있는가?
- RQ2잔차 브랜치에 $1/\sqrt{\text{depth}}$ 스케일링을 적용하면 무한 넓이 및 무한 깊이 근사에서 안정적인 학습 동역학을 달성할 수 있는가?
- RQ3제안된 매개변수화 방식은 표준 $\mu$P 및 배치 정규화와 비교해 깊이를 초월한 초매개변수 이전에 얼마나 효과적인가?
- RQ4DMFT 프레임워크는 이 새로운 매개변수화를 적용한 잔차 네트워크의 동시 무한 넓이 및 무한 깊이 근사를 기술할 수 있는가?
- RQ5제안된 방법은 학습률 외에도 모멘터 및 가중치 감쇠와 같은 다른 초매개변수의 이전을 지원하는가?
주요 결과
- 제안된 $1/\sqrt{\text{depth}}$-ResNet과 $\mu$P 초기화는 CIFAR-10에서 넓이와 깊이를 초월해 최적의 학습률을 이전할 수 있으며, 테스트된 깊이 범위에서 발산하는 경우가 전혀 관찰되지 않았다.
- 실험 결과는 고정된 학습률 외에도 복잡한 스케줄링(예: 순환 및 코즈인 앤날링 스케줄링)에 대해 일관된 초매개변수 이전이 이루어짐을 보여준다.
- 제안된 매개변수화를 사용해 훈련된 비전 트랜스포머 역시 배치 정규화 유무에 관계없이 최적의 초매개변수를 이전함을 보였다.
- 표준 배치 정규화가 적용된 ResNets에 비해 제안된 방법은 초매개변수 이전 성능을 향상시켰으며, 이는 큰 깊이에서조차도 부분적인 향상에 그치고 일관성 없음을 보여준다.
- DMFT를 통한 이론적 분석은 특성 및 예측 업데이트가 네트워크 크기와 무관하게 잘 정의된 근사로 수렴하는 무한 넓이 및 무한 깊이 근사를 확인했으며, 깊은 선형 네트워크에 대해 정확한 해를 도출했다.
- ODE 스케일링($\alpha=1$) 하에서는 깊이 증가에 따라 단조로운 향상이 관찰되었고, SDE 스케일링($\alpha=1/2$)은 초기 시간대에 비단조적 행동를 보였으며, 이는 수렴 역학이 다름을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.