[논문 리뷰] Why Do We Need Weight Decay in Modern Deep Learning?
이 논문은 현대 딥러닝에서 가중치 감소가 직접적인 정규화 기법으로서의 역할 이외에도 주로 최적화 동역학을 변화시킨다는 점을 드러낸다. 가중치 감소는 확률적 최적화에서 편향-분산 균형을 조절함으로써 훈련을 안정화시키며, 과매개변수화된 모델에서 일반화 성능을 향상시키고, bfloat16 혼합 정밀도 훈련에서 손실 발산을 방지한다. 이는 가중치 감소가 명시적 정규화 기능이 제한적이지만 대규모 언어 모델 훈련의 효율성과 안정성에 필수적이라는 점을 시사한다.
Weight decay is a broadly used technique for training state-of-the-art deep networks from image classification to large language models. Despite its widespread usage and being extensively studied in the classical literature, its role remains poorly understood for deep learning. In this work, we highlight that the role of weight decay in modern deep learning is different from its regularization effect studied in classical learning theory. For deep networks on vision tasks trained with multipass SGD, we show how weight decay modifies the optimization dynamics enhancing the ever-present implicit regularization of SGD via the loss stabilization mechanism. In contrast, for large language models trained with nearly one-epoch training, we describe how weight decay balances the bias-variance tradeoff in stochastic optimization leading to lower training loss and improved training stability. Overall, we present a unifying perspective from ResNets on vision tasks to LLMs: weight decay is never useful as an explicit regularizer but instead changes the training dynamics in a desirable way. The code is available at https://github.com/tml-epfl/why-weight-decay
연구 동기 및 목표
- 현대 딥러닝, 특히 과매개변수화된 모델과 대규모 언어 모델(Lang. Model, LLM)에서 가중치 감소의 진정한 역할을 명확히 하기 위해.
- 현대 환경에서 명시적 정규화 기능이 제한적인 데도 불구하고 가중치 감소가 필수적인 이유를 조사하기 위해.
- bfloat16 혼합 정밀도 환경에서 가중치 감소가 훈련을 어떻게 안정화시키는지, 이는 대규모 언어 모델 훈련을 확장하는 데 필수적인 조건임을 설명하기 위해.
- 가중치 감소가 암묵적 정규화, 최적화 동역학, 수치적 안정성에 미치는 영향을 구분하기 위해.
제안 방법
- 과매개변수화된 ResNets를 분석하여, 가중치 감소가 손실 안정성과 헤시안 추적 정규화를 통해 암묵적 정규화를 향상시킨다는 점을 보여준다.
- 거의 한 번의 순환만으로 훈련된 LLM을 연구하여, 가중치 감소가 확률적 최적화에서 편향-분산 트레이드오프를 균형 잡는 데 기여하고 훈련 손실을 감소시킨다는 점을 입증한다.
- 비전 및 언어 모델 전반에서의 실험적 아블레이션 연구를 통해 가중치 감소가 훈련 동역학과 손실 안정성에 미치는 영향을 분리하여 분석한다.
- bfloat16 훈련 실험을 통해 가중치 감소가 기울기 폭발이 아닌 수치 정밀도 제한으로 인한 후기 훈련 손실 발산을 방지한다는 점을 입증한다.
- 학습률 스케줄링과 가중치 평균화와의 비교를 통해 가중치 감소가 수렴과 일반화에 미치는 영향을 평가한다.
- 가중치 감소를 정규화가 아닌 동적 최적화기 수정자로 보는 통합적 시각을 제안하며, 이는 비전 및 언어 작업 전반에서 검증된다.

실험 결과
연구 질문
- RQ1왜 현대 딥러닝에서 가중치 감소는 명시적 정규화 기능이 제한적인 데도 널리 사용되는가?
- RQ2가중치 감소는 정규화 외적으로 과매개변수화된 딥 네트워크에서 최적화 동역학에 어떻게 영향을 미치는가?
- RQ3왜 가중치 감소는 대규모 언어 모델의 bfloat16 혼합 정밀도 훈련에서 훈련 안정성을 향상시키는가?
- RQ4현대 LLM에서 가중치 감소는 일반화에 영향을 주는가, 아니면 훈련 손실 최소화에 영향을 주는가?
- RQ5가중치 감소는 확률적 최적화에서 편향-분산 트레이드오프를 균형 잡는 메커니즘으로 이해될 수 있는가?
주요 결과
- bfloat16 혼합 정밀도 훈련에서 가중치 감소는 수치 정밀도 제한으로 인한 후기 훈련 발산을 방지함으로써 손실을 안정화시키며, float32 훈련에서는 안정한 경우에도 효과를 발휘한다.
- 과매개변수화된 ResNets의 경우, 가중치 감소는 손실 궤적을 안정화시키고 헤시안 추적 정규화를 통해 암묵적 정규화를 향상시켜 일반화 성능을 향상시킨다.
- 거의 한 번의 순환만으로 훈련된 대규모 언어 모델에서, 가중치 감소는 명시적 정규화 외에 확률적 최적화에서 편향-분산 트레이드오프를 더 잘 균형 잡음으로써 훈련 손실을 감소시킨다.
- bfloat16 환경에서 높은 학습률(예: 0.001)에서도 가중치 감소를 통해 안정적인 훈련이 가능하며, 학습률을 낮추는 것보다 효율적이고 빠르다. 이는 가중치 감소가 더 효율적인 해결책임을 시사한다.
- 현대 딥러닝에서 가중치 감소는 주된 정규화 기법이 아니다. 오히려 그 광범위한 사용은 수렴성과 안정성을 향상시키는 방식으로 최적화 동역학을 조정할 수 있다는 능력에서 기인한다.
- 실험 결과, 일정한 학습률을 유지하는 가중치 감소는 학습률 감소와 가중치 평균화를 조합한 경우와 거의 동일한 성능을 보이며, 이는 가중치 감소의 역할이 하이퍼파rameter 튜닝이 아닌 동적 제어에 더 가깝다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.