[논문 리뷰] Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be
이 논문은 트랜스포머에서 SGD보다 Adam의 성능이 뛰어난 이유가 주로 무거운 尾를 가진 확률적 경사하강 노이즈 때문이라는 가설을 도전한다. 대신, 이 논문은 Adam이 전체 배치 설정에서도 여전히 SGD를 능가한다는 점을 발견하였으며, 이는 Adam의 행동이 운동량을 가진 부호 강하와 유사하기 때문이며, 이는 노이즈에 대한 내성보다는 결정론적이고 적응적인 경사 정규화가 성능 격차를 이끄는 핵심 요소임을 시사한다.
The success of the Adam optimizer on a wide array of architectures has made it the default in settings where stochastic gradient descent (SGD) performs poorly. However, our theoretical understanding of this discrepancy is lagging, preventing the development of significant improvements on either algorithm. Recent work advances the hypothesis that Adam and other heuristics like gradient clipping outperform SGD on language tasks because the distribution of the error induced by sampling has heavy tails. This suggests that Adam outperform SGD because it uses a more robust gradient estimate. We evaluate this hypothesis by varying the batch size, up to the entire dataset, to control for stochasticity. We present evidence that stochasticity and heavy-tailed noise are not major factors in the performance gap between SGD and Adam. Rather, Adam performs better as the batch size increases, while SGD is less effective at taking advantage of the reduction in noise. This raises the question as to why Adam outperforms SGD in the full-batch setting. Through further investigation of simpler variants of SGD, we find that the behavior of Adam with large batches is similar to sign descent with momentum.
연구 동기 및 목표
- 트랜스포머 모델에서 Adam의 성능이 SGD를 능가하는 데 있어, 중량이 두꺼운 확률적 경사하강 노이즈가 주요 원인인지 여쭤보기.
- 배치 크기를 다양하게 변화시켜 확률성을 평가함으로써 노이즈의 역할을 분석하기.
- 노이즈 효과가 최소화되는 저노이즈, 전체 배치 설정에서 Adam이 왜 SGD를 능가하는지 탐구하기.
- 성능 격차를 더 잘 설명할 수 있는 결정론적 성질(예: 경사 부호 적응)이 있는지 확인하기.
- 대규모 배치 환경에서 Adam의 행동이 부호 강하와 운동량을 갖춘 것과 유사한지 분석함으로써, 그 성공에 대한 새로운 이론적 설명을 제시하기.
제안 방법
- 언어 모델링 작업(Python, Wikitext2, SQuAD)과 이미지 작업(MNIST, CIFAR-10)을 대상으로 다양한 배치 크기(전체 배치 포함)에서 SGD와 Adam을 실증적으로 평가하기.
- QQ-플롯을 사용하여 확률적 경사 오차 분포(‖g − g̃‖)를 정규분포 및 α-스테이블 분포와 비교함으로써 尾의 무거움을 평가하기.
- 확률적 노이즈가 제거된 전체 배치 설정에서 최적화기 행동을 분석함으로써 결정론적 요소를 고립하기.
- 특히 좌표별 경사 부호 추정 측면에서 Adam의 업데이트 동역학을 부호 강하와 운동량의 조합과 비교하기.
- 부호 기반 업데이트와 운동량의 영향을 고립하기 위해 아블레이션 스터디와 단순화된 최적화기를 사용하기.
- 하이퍼파ram터에 대한 격자 탐색을 수행하고 학습 손실 추세를 보고하며, 일반화 성능에 대한 통찰을 뒷받침하기 위해 검증 지표를 활용하기.
실험 결과
연구 질문
- RQ1트랜스포머에서 SGD와 Adam 간의 성능 격차가 이전에 제기된 바와 같이 중량이 두꺼운 확률적 경사하강 노이즈 때문인지 여쭤보기.
- RQ2배치 크기가 증가함에 따라 SGD와 Adam 간의 성능 격차는 어떻게 변화하는가? 특히 노이즈가 최소화되는 경우에 대해.
- RQ3전체 배치 설정에서 Adam의 우월한 성능은 노이즈에 대한 내성성이 그 성공의 주요 요인임을 부정하는가?
- RQ4대규모 배치 학습에서 Adam의 행동이 부호 강하와 운동량을 갖춘 것과 어느 정도 유사한가?
- RQ5어떤 아키텍처나 최적화 성질이 트랜스포머에서 CNN에 비해 SGD와 Adam 간의 격차를 더 크게 만드는가?
주요 결과
- 확률적 노이즈가 제거된 전체 배치 설정에서도 SGD와 Adam 간의 성능 격차가 지속되며, 이는 노이즈에 대한 내성성이 Adam의 성공의 주요 원인라는 가설을 반박한다.
- 배치 크기가 증가함에 따라 Adam은 여전히 SGD를 능가하지만, SGD는 노이즈 감소의 이점을 얻지 못함을 확인하여, 격차가 노이즈 유발이 아님을 시사한다.
- 대규모 배치 학습에서 Adam의 행동은 부호 강하와 운동량을 갖춘 것과 유사하게 나타나며, 이는 좌표별 부호 추정이 그 우월성의 근본 원인일 수 있음을 시사한다.
- 언어 작업에서 관찰된 성능 격차는 중량이 두꺼운 경사 노이즈로 설명되지 않으며, QQ-플롯 분석 결과 경사 오차 분포가 이전에 주장된 것보다 덜 중량이 두꺼운 것으로 나타났다.
- ResNet18을 사용한 CIFAR-10과 같은 이미지 작업에서는 SGD와 Adam 간 격차가 더 작고 일관성이 떨어지며, 이는 아키텍처적 요인(예: 배치 정규화)이 최적화기 행동에 영향을 줄 수 있음을 시사한다.
- 학습 손실에서 더 우수한 성능를 보이는 최적화기는 더 빨리 낮은 검증 손실을 달성함을 확인하여, 이 설정에서 학습 역학과 일반화 성능 간의 상관관계를 확인할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.