Skip to main content
QUICK REVIEW

[논문 리뷰] On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective

Zeke Xie, Zhiqiang Xu|arXiv (Cornell University)|2020. 11. 23.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 Adam과 같은 적응형 최적화 방법에서의 가중치 감소가 학습 종료 시 큰 기울기 노름을 유도할 수 있으며, 이는 수렴성과 일반화 능력을 해칠 수 있음을 규명한다. 이를 완화하기 위해 기울기 노름을 고려한 스케줄러인 스케줄링된 가중치 감소(SWD)를 제안한다. 이는 기울기 노름이 증가할 경우 가중치 감소 강도를 동적으로 감소시키는 방식으로, 일반화 능력 향상에 크게 기여하며, 종종 SGD 성능을 능가하거나 이를 충족시킨다.

ABSTRACT

Weight decay is a simple yet powerful regularization technique that has been very widely used in training of deep neural networks (DNNs). While weight decay has attracted much attention, previous studies fail to discover some overlooked pitfalls on large gradient norms resulted by weight decay. In this paper, we discover that, weight decay can unfortunately lead to large gradient norms at the final phase (or the terminated solution) of training, which often indicates bad convergence and poor generalization. To mitigate the gradient-norm-centered pitfalls, we present the first practical scheduler for weight decay, called the Scheduled Weight Decay (SWD) method that can dynamically adjust the weight decay strength according to the gradient norm and significantly penalize large gradient norms during training. Our experiments also support that SWD indeed mitigates large gradient norms and often significantly outperforms the conventional constant weight decay strategy for Adaptive Moment Estimation (Adam).

연구 동기 및 목표

  • 적응형 최적화에서 가중치 감소의 간과된 위험 요소를 규명하는 것, 특히 학습 종료 시 큰 기울기 노름을 유도하는 경향을 분석하는 것.
  • 기울기 노름이 크면 적응형 최적화 방법(예: Adam)에서 수렴성과 일반화 능력에 부정적인 영향을 미치는 방식을 분석하는 것.
  • 학습 중 기울기 노름에 따라 동적으로 강도를 조절하는 새로운 기울기 노름 인식 스케줄러를 제안하는 것.
  • SWD가 Adam에서 일정한 가중치 감소 전략보다 일반화 및 수렴성을 향상시킨다는 것을 경험적으로 검증하는 것.
  • CNN에서 Adam과 SGD 사이의 일반화 격차를 SWD가 얼마나 줄일 수 있는지 보여주는 것.

제안 방법

  • 논문은 기울기 노름의 달리기 평균에 기반해 감소 강도를 조절하는 동적 가중치 감소 스케줄러인 스케줄링된 가중치 감소(SWD)를 도입한다.
  • SWD는 기울기 노름이 증가할 경우 가중치 감소를 감소시키는 기울기 노름 인식 메커니즘을 사용하며, 음성 피드백 시스템처럼 작동한다.
  • 이 방법은 가중치 감소 항을 분리하고, 제곱 기울기 노름의 이동 평균의 역수로 스케일링하여 Adam에 통합된다.
  • 핵심 업데이트 규칙은 Adam의 파라미터 업데이트를 수정하여 학습률 조정을 $ \frac{1}{\sqrt{\bar{v}_t} + \epsilon} $ 비례로 조정한다. 여기서 $ \bar{v}_t $는 비중앙화 두 번째 모멘트 추정치의 평균이다.
  • 스케줄러는 큰 기울기 노름을 방지하도록 설계되어 있으며, 낮은 기울기 노름이 더 평평한 최소값과 더 나은 일반화 능력과 관련이 있다는 이론적 통찰과 일치한다.
  • SWD는 다른 최적화 방법과도 호환되며 재학습이 필요 없어 기존 학습 파ip라인에 즉시 통합할 수 있는 플러그인 개선 방법이다.

실험 결과

연구 질문

  • RQ1Adam에서 가중치 감소는 학습 종료 시 큰 기울기 노름을 유도하는가? 만약 그렇다면 그 이유는 무엇인가?
  • RQ2학습 종료 시 큰 기울기 노름이 모델의 수렴성과 일반화에 어떤 영향을 미치는가?
  • RQ3기울기 노름에 따라 동적으로 조절하는 가중치 감소 스케줄러는 일정한 가중치 감소 전략보다 Adam에서 일반화 능력을 향상시킬 수 있는가?
  • RQ4SWD는 CNN에서 Adam과 SGD 사이의 일반화 격차를 어느 정도 줄일 수 있는가?
  • RQ5학습률과 초기 가중치 감소 값과 같은 하이퍼파rameter 선택에 대해 SWD는 얼마나 강인한가?

주요 결과

  • SWD는 특히 Adam에서 학습 종료 시 큰 기울기 노름을 크게 감소시켜 수렴성과 일반화 능력을 향상시킨다.
  • VGG16를 사용한 CIFAR-10에서, AdamS(Adam에 SWD를 적용한 버전)는 테스트 오차 4.52%를 기록하여 AdamW(4.90%)와 Adam(5.49%)을 모두 앞서며 성능을 뛰어넘었다.
  • ResNet18에서도 AdamS는 4.52%의 테스트 오차를 기록했고, AdamW는 4.90%, Adam은 5.49%였으며, 이는 일관된 승리임을 보여준다.
  • 코즈인 학습률 스케줄링과 온도 상승 재시작을 적용한 경우, 모든 모델에서 AdamS는 AdamW와 Adam보다 낮은 테스트 오차와 학습 손실을 유지했다.
  • AdamS는 다양한 가중치 감소 값에 대해 높은 강인성을 보이며, 넓은 범위의 하이퍼파ram터 설정에서도 뛰어난 성능을 유지했다.
  • 어떤 경우, 예를 들어 언어 모델링 작업에서는 SWD가 $L_2$ 정규화보다 성능 향상이 없었으며, 이는 특정 작업에서는 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.