[논문 리뷰] Toward Understanding Why Adam Converges Faster Than SGD for Transformers
이 논문은 방향성 뾰족함(directional sharpness)을 핵심 지표로 도입하여, 트랜스포머에서 Adam이 SGD보다 수렴 속도가 빠른 이유를 설명한다: SGD는 좌표 간 기울기가 비균형하여 높은 방향성 뾰족함을 경험하는 반면, Adam의 적응형 학습률은 이 뾰족함을 줄인다. 저자들은 이러한 문제를 완화하기 위해 좌표별 클리핑을 제안하며, 다양한 최적화 알고리즘에서 수렴 속도 향상과 국소 손실 감소를 입증한다.
While stochastic gradient descent (SGD) is still the most popular optimization algorithm in deep learning, adaptive algorithms such as Adam have established empirical advantages over SGD in some deep learning applications such as training transformers. However, it remains a question that why Adam converges significantly faster than SGD in these scenarios. In this paper, we propose one explanation of why Adam converges faster than SGD using a new concept directional sharpness. We argue that the performance of optimization algorithms is closely related to the directional sharpness of the update steps, and show SGD has much worse directional sharpness compared to adaptive algorithms. We further observe that only a small fraction of the coordinates causes the bad sharpness and slow convergence of SGD, and propose to use coordinate-wise clipping as a solution to SGD and other optimization algorithms. We demonstrate the effect of coordinate-wise clipping on sharpness reduction and speeding up the convergence of optimization algorithms under various settings. We show that coordinate-wise clipping improves the local loss reduction when only a small fraction of the coordinates has bad sharpness. We conclude that the sharpness reduction effect of adaptive coordinate-wise scaling is the reason for Adam's success in practice and suggest the use of coordinate-wise clipping as a universal technique to speed up deep learning optimization.
연구 동기 및 목표
- SGD와 Adam이 유사한 이론적 수렴 속도를 가짐에도 불구하고 트랜스포머 학습에서 Adam이 왜 더 우수한지 이해하기 위해.
- 딥러닝에서 수렴 속도에 영향을 주는 최적화 경로의 기하적 성질을 규명하기 위해.
- 신경망 좌표 간 기울기 불균형이 SGD 성능 저하에 기여하는 정도를 분석하기 위해.
- 방향성 뾰족함을 줄이는 데 기여하는 단순하고 보편적인 기법인 좌표별 클리핑을 제안하기 위해.
- 적응형 스케일링을 통한 뾰족함 감소가 Adam의 경험적 성공의 핵심 이유임을 검증하기 위해.
제안 방법
- 수정 방향에 沿한 곡률을 측정하는 지표로 방향성 뾰족함을 도입하여, 기존 지표보다 최적화 성능 예측에 더 적합하다고 주장한다.
- 방향성 뾰족함을 업데이트 방향에 투영된 헤시안의 스펙트럴 노름으로 정의하여 국소 함수의 매끄러움을 캡처한다.
- 높은 기울기와 높은 뾰족함을 가진 좌표의 영향을 제한하기 위해 좌표별 클리핑을 제안하여 전체 방향성 뾰족함을 감소시킨다.
- 신경망의 국소 곡률를 추정하기 위해 크로스 엔트로피 손실에 대해 가우스-뉴턴 헤시안 근사를 사용한다.
- 매개변수 갱신 이전에 기울기에 클리핑을 적용하여 더 큰 안정적인 스텝 크기를 가능하게 하고 국소 손실 감소를 향상시킨다.
- 트랜스포머와 ResNet에서 다양한 최적화기(SGD, Adam, Adafactor 등)를 대상으로 방향성 뾰족함과 수렴 속도를 평가한다.
실험 결과
연구 질문
- RQ1SGD와 유사한 이론적 수렴 보장을 가짐에도 불구하고 트랜스포머 학습에서 Adam이 왜 상당히 더 빠르게 수렴하는가?
- RQ2딥러닝에서 수렴 속도와 관련된 최적화 경로의 기하적 성질은 무엇인가?
- RQ3SGD의 열악한 성능이 좌표 간 기울기 불균형으로 인한 높은 방향성 뾰족함 때문인가? 그 정도는 어느 정도인가?
- RQ4좌표별 클리핑이 방향성 뾰족함을 줄여 최적화 알고리즘의 수렴을 보편적으로 향상시킬 수 있는가?
- RQ5관측된 뾰족함 행동은 트랜스포머에 특화된 것이며, 아키텍처 전반에 일반화되는가?
주요 결과
- 특히 트랜스포머의 초기 학습 단계에서 SGD는 Adam보다 상당히 높은 방향성 뾰족함을 보인다.
- SGD의 방향성 뾰족함의 대부분을 차지하는 좌표는 전체의 1%에서 2.5%에 불과하여 기울기 크기의 강한 불균형이 있음을 시사한다.
- 이러한 고뾰족함 좌표를 좌표별 클리핑으로 제거함으로써 함수의 매끄러움이 2~3배 향상되어 국소 손실 감소 속도가 빨라진다.
- 좌표별 클리핑은 Adam과 Adafactor를 포함한 모든 테스트된 최적화기에서 방향성 뾰족함을 감소시키며 일관되게 수렴 속도를 향상시킨다.
- ResNet과 같은 비트랜스포머 아키텍처에서는 Adam과 Adafactor의 방향성 뾰족함이 SGD를 초과할 수 있음을 확인하여, 이 현상이 트랜스포머에 특화되어 있음을 보여준다.
- 최적의 스텝 크기를 사용할 경우, 낮은 방향성 뾰족함을 가진 알고리즘은 상당히 더 좋은 국소 손실 감소를 달성하여 뾰족함이 성능 예측의 핵심 요소임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.