Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness to Unbounded Smoothness of Generalized SignSGD

Michael Crawshaw, Mingrui Liu|arXiv (Cornell University)|2022. 08. 23.
Sparse and Compressive Sensing Techniques인용 수 4
한 줄 요약

이 논문은 기울기 클리핑이 필요 없이도, 기울기와 헤시안 노름이 유계가 아니게 증가할 수 있는 완화된 $(L_0, L_1)$ 스무쓰니스 조건 하에서 기울기 클리핑된 SGD와 유사한 수렴 속도를 달성하는 일반화된 SignSGD 알고리즘을 제안한다. 이 방법은 동적 모멘타를 통해 비유계 스무쓰니스와 기울기 노름을 암묵적으로 제어함으로써, Transformer와 같은 딥러닝 모델에서 안정적인 성능을 보이며, Adam의 정확도를 따라가지만 다른 최적화 알고리즘보다 뛰어나다.

ABSTRACT

Traditional analyses in non-convex optimization typically rely on the smoothness assumption, namely requiring the gradients to be Lipschitz. However, recent evidence shows that this smoothness condition does not capture the properties of some deep learning objective functions, including the ones involving Recurrent Neural Networks and LSTMs. Instead, they satisfy a much more relaxed condition, with potentially unbounded smoothness. Under this relaxed assumption, it has been theoretically and empirically shown that the gradient-clipped SGD has an advantage over the vanilla one. In this paper, we show that clipping is not indispensable for Adam-type algorithms in tackling such scenarios: we theoretically prove that a generalized SignSGD algorithm can obtain similar convergence rates as SGD with clipping but does not need explicit clipping at all. This family of algorithms on one end recovers SignSGD and on the other end closely resembles the popular Adam algorithm. Our analysis underlines the critical role that momentum plays in analyzing SignSGD-type and Adam-type algorithms: it not only reduces the effects of noise, thus removing the need for large mini-batch in previous analyses of SignSGD-type algorithms, but it also substantially reduces the effects of unbounded smoothness and gradient norms. We also compare these algorithms with popular optimizers on a set of deep learning tasks, observing that we can match the performance of Adam while beating the others.

연구 동기 및 목표

  • 딥러닝 모델인 Transformer와 LSTMs가 비유계 스무쓰니스를 보이는 데서 기인한 전통적 스무쓰니스 가정의 한계를 해결하기 위해.
  • 특히 Adam 유형 알고리즘에 대해, 기울기 클리핑이 필요 없이 완화된 $(L_0, L_1)$ 스무쓰니스 조건 하에서도 수렴이 가능하다는 것을 보여주기 위해.
  • SignSGD와 Adam 사이를 연결하는 일반화된 SignSGD 알고리즘을 제안하고, 명시적 클리핑이 필요 없도록 이론적으로 분석하기 위해.
  • 모멘타만으로도 비유계 스무쓰니스 하에서 훈련을 안정화시킬 수 있음을 경험적으로 검증하여, Adam에서 클리핑이 효과가 없는 이유를 설명하기 위해.

제안 방법

  • 한쪽 끝에서는 SignSGD를 복원하고 다른 쪽 끝에서는 Adam과 유사하게 행동하는 일반화된 SignSGD 알고리즘을 제안하며, 적응형 모멘타와 정규화된 기울기 부호를 사용한다.
  • 딥 네트워크의 레이어와 파라미터 간의 비균일한 기울기 행동을 더 잘 포착하기 위해 좌표별 $(L_0, L_1)$ 스무쓰니스 가정을 도입한다.
  • 모멘타가 기울기 노름과 스무쓰니스 항목에 대해 지수 감소를 유도함으로써, 비유계 스무쓰니스 하에서도 수렴을 이론적으로 증명한다.
  • 모멘타를 통해 노이즈 영향을 줄이고 비유계 기울기 노름의 영향을 억제함으로써, 명시적 클리핑을 효과적으로 대체한다.
  • 하이퍼파라미터(학습률, 가중치 감쇠, $eta_2$)를 튜닝하고 최적화 알고리즘 간 성능을 비교하기 위해 그리드 서치와 반복적인 훈련 실행을 수행한다.
  • WMT’16 독일-영어 번역 및 Wikitext-2 작업에서 방법을 검증하며, 다섯 개의 랜덤 시드에 걸쳐 훈련 손실, 퍼플렉서티, 정확도를 측정한다.

실험 결과

연구 질문

  • RQ1명시적 기울기 클리핑 없이도, 완화된 $(L_0, L_1)$ 스무쓰니스 조건 하에서 SignSGD 유형 알고리즘이 클리핑된 SGD와 유사한 수렴 속도를 달성할 수 있는가?
  • RQ2모멘타는 비유계 스무쓰니스와 기울기 노름의 영향을 어떻게 완화하는가?
  • RQ3Adam의 비유계 스무쓰니스에 대한 강건성은 암묵적 클리핑에서 기인하는가? 이는 SignSGD 프레임워크에서 재현될 수 있는가?
  • RQ4SignSGD와 Adam을 연결하는 통합 알고리즘을 설계할 수 있는가? 이는 이론적 강건성과 경험적 성능을 모두 제공해야 한다.
  • RQ5비유계 스무쓰니스 하에서 대규모 Transformer 모델에서 일반화된 SignSGD 알고리즘이 Adam의 성능을 따라하거나 초월할 수 있는가?

주요 결과

  • 제안된 일반화된 SignSGD 알고리즘은 WMT’16 독일-영어 번역 작업에서 테스트 퍼플렉서티 7.2731 ± 0.0870을 달성하여, 모멘타와 클리핑이 있는 SGD를 포함한 모든 베이스라인을 능가했다.
  • 이 알고리즘은 Adam의 테스트 정확도 68.9828 ± 0.2786을 그대로 따라가며, Adam의 1.4303 ± 0.0009보다 훨씬 낮은 훈련 손실 1.6263 ± 0.0024를 기록했다.
  • 경험적 결과로, 대규모 Transformer 모델 훈련에서 기울기 클리핑이 Adam의 성능에 미치는 영향이 측정할 수 없을 정도로 작다는 것이 확인되었으며, 이는 두 번째 모멘트 정규화를 통한 암묵적 클리핑을 시사한다.
  • 좌표별 $(L_0, L_1)$ 스무쓰니스 가정은 Transformer에서 경험적으로 검증되었으며, 레이어와 파라미터 간에 다릅니다.
  • 모멘타가 비유계 스무쓰니스와 기울기 노름을 억제하는 데 핵심적인 역할을 함을 입증하였으며, 이는 명시적 클리핑 없이도 안정적인 수렴을 가능하게 한다.
  • 모멘타와 클리핑이 있는 SGD는 제안된 방법보다 성능이 열 劣하므로, 모멘타가 이미 기울기 성장을 효과적으로 제어하고 있을 경우 클리핑이 유익하지 않다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.