[논문 리뷰] On the Convergence of AdaBound and its Connection to SGD
이 논문은 AdaBound, Adam과 SGD 사이의 격차를 메우기 위해 설계된 인기 있는 적응형 최적화 방법의 수렴 증명에서 심각한 결함을 밝혀낸다. 더 약한 가정 하에 재정비된 $O(\sqrt{T})$ 손실 보장이 제안되며, 실험적으로는 감쇠된 업데이트를 가진 특정 형태의 모멘타ム SGD가 더 적은 초모수와 낮은 계산 비용으로 CIFAR-10에서 AdaBound의 성능을 따라잡는다.
Adaptive gradient methods such as Adam have gained extreme popularity due to their success in training complex neural networks and less sensitivity to hyperparameter tuning compared to SGD. However, it has been recently shown that Adam can fail to converge and might cause poor generalization -- this lead to the design of new, sophisticated adaptive methods which attempt to generalize well while being theoretically reliable. In this technical report we focus on AdaBound, a promising, recently proposed optimizer. We present a stochastic convex problem for which AdaBound can provably take arbitrarily long to converge in terms of a factor which is not accounted for in the convergence rate guarantee of Luo et al. (2019). We present a new $O(\sqrt T)$ regret guarantee under different assumptions on the bound functions, and provide empirical results on CIFAR suggesting that a specific form of momentum SGD can match AdaBound's performance while having less hyperparameters and lower computational costs.
연구 동기 및 목표
- Luo 등(2019)에서 제시된 AdaBound의 수렴 증명에 존재하는 결함을 식별하고 수정하는 것.
- 원래 정리보다 더 엄격하지 않은 가정 하에 AdaBound에 대한 새로운 손실 보장을 수립하는 것.
- AdaBound의 성능이 더 간단한 최적화 방법을 통해 더 낮은 계산 비용과 더 적은 초모수로 재현 가능한지 실험적으로 평가하는 것.
- 모멘타ム SGD에서 감쇠 인자 역할을 하는 요소의 역할과 AdaBound과의 최적화 역학적 영향을 조사하는 것.
제안 방법
- 저자들은 AdaBound의 수렴 보장을 위반하는 스토하스틱 볼록 최적화 문제를 구성하여, Luo 등(2019)의 정리 4에 대한 반례를 제시한다.
- 모니터리시티와 동일한 극한으로 수렴하는 조건을 완화한 새로운 경계 함수에 대한 가정을 도입하여, 새로운 $O(\sqrt{T})$ 손실 경계를 도출한다.
- 저자들은 AdaBound을 재구현하고, 그와 동일한 모멘타ム 업데이트를 가지는 감쇠 인자 $\kappa = \beta_1$를 가진 수정된 SGD 형태와 비교한다.
- 초모수를 원래 AdaBound 설정과 일치시키기 위해 Wide ResNet 28-2를 사용하여 CIFAR-10에서 실험을 수행한다.
- 다양한 $\gamma$ 값에 따른 AdaBound의 성능 분석과 감쇠된 SGD 변형에서의 편향 보정 영향 평가를 수행한다.
- 제거 분석을 통해 편향 보정 여부에 따라 다양한 $\gamma$ 값과 최적화 방법 설정에서의 학습 정확도 및 테스트 정확도를 비교한다.
실험 결과
연구 질문
- RQ1Luo 등(2019)의 정리 4에서 제시된 AdaBound의 수렴 보장이 모든 조건에서 성립하는가, 아니면 반례가 존재하는가?
- RQ2모니터리시티와 경계 함수의 동일한 극한 수렴 조건을 제거한 더 약한 가정 하에 AdaBound에 대한 새로운 손실 경계를 유도할 수 있는가?
- RQ3감쇠 인자 $\kappa = \beta_1$를 가진 단순한 모멘타ム SGD 형태가 이미지 분류 작업에서 AdaBound의 성능을 따라잡을 수 있는가?
- RQ4AdaBound의 수렴과 최종 성능에 $\gamma$ 초모수의 영향은 어떠한가?
- RQ5편향 보정이 감쇠된 SGD 변형의 안정성과 성능에 영향을 주는가?
주요 결과
- Luo 등(2019)의 정리 4의 모든 가정을 만족하나도 AdaBound이 수렴하지 않는 반례를 구성하여, 이 정리가 잘못되었음을 입증한다.
- 모니터리시티와 동일한 극한 수렴 조건이 필요 없도록 약화된 가정 하에 AdaBound에 대해 새로운 $O(\sqrt{T})$ 손실 보장을 수립한다.
- AdaBound에서 $\gamma = 10^{-10}$을 사용할 경우 $\gamma = 0.001$과 비교해 학습 정확도와 최종 테스트 정확도 모두 심각한 성능 저하를 보인다.
- 감쇠 인자 $\kappa = \beta_1$를 가진 모멘타ム SGD 변형은 CIFAR-10에서 최종 테스트 정확도 94.01%를 기록하여, 다섯 번의 런 평균 93.90%를 기록한 AdaBound을 略로 뛰어넘는다.
- 감쇠된 SGD 변형은 업데이트당 5d 부동소수점 연산만 필요로 하며, AdaBound의 11d에 비해 계산 비용이 낮고, 초모수도 다섯 개에서 두 개로 줄어든다.
- 감쇠된 SGD 변형에서 편향 보정을 적용하면 최종 테스트 정확도의 표준편차가 0.21에서 0.16으로 감소하여 안정성이 향상되며, 평균 성능에는 영향을 주지 않는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.