Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding the Generalization of Adam in Learning Neural Networks with Proper Regularization

Difan Zou, Yuan Cao|arXiv (Cornell University)|2021. 08. 25.
Neural Networks and Applications참고 문헌 35인용 수 6
한 줄 요약

이 논문은 딥러닝에서 정규화를 적절히 적용함에도 불구하고 Adam이 경사하강법(GD)보다 일반화 성능이 떨어지는 이유를 설명한다. 오버파ram터화된 두 층의 CNN과 이미지 유사 데이터에서, Adam과 GD는 서로 다른 전역 최적해로 수렴한다: GD는 의미 있는 특징을 학습하고 거의 영점의 테스트 오차를 달성하는 반면, Adam은 노이즈를 피팅하고 무작위 추측과 비슷한 성능을 보인다. 이는 비볼록 최적화 지형 때문이다.

ABSTRACT

Adaptive gradient methods such as Adam have gained increasing popularity in deep learning optimization. However, it has been observed that compared with (stochastic) gradient descent, Adam can converge to a different solution with a significantly worse test error in many deep learning applications such as image classification, even with a fine-tuned regularization. In this paper, we provide a theoretical explanation for this phenomenon: we show that in the nonconvex setting of learning over-parameterized two-layer convolutional neural networks starting from the same random initialization, for a class of data distributions (inspired from image data), Adam and gradient descent (GD) can converge to different global solutions of the training objective with provably different generalization errors, even with weight decay regularization. In contrast, we show that if the training objective is convex, and the weight decay regularization is employed, any optimization algorithms including Adam and GD will converge to the same solution if the training is successful. This suggests that the inferior generalization performance of Adam is fundamentally tied to the nonconvex landscape of deep learning optimization.

연구 동기 및 목표

  • 정규화를 적절히 적용함에도 불구하고 딥 네ural 네트워크에서 Adam과 GD 사이에 지속적인 일반화 격차가 존재하는 이유를 설명하는 것.
  • 정규화만으로 Adam과 GD 간의 성능 격차를 해소할 수 있는지 조사하는 것.
  • 이미지 유사 데이터를 가진 오버파라미터화된 비볼록 두 층의 CNN 환경에서 Adam과 GD의 수렴 및 일반화 행동을 분석하는 것.
  • 볼록 최적화 지형과 비볼록 최적화 지형에서 Adam과 GD의 행동을 대조하는 것.

제안 방법

  • 저자는 특징 패치와 노이즈 패치로 구성된 데이터에서 학습하는 두 층의 컨볼루션 네트워크를 연구하며, 이미지 유사 분포를 모델링한다.
  • 정규화로 가중치 감쇠를 사용하고, Adam과 GD 최적화 하에서의 학습 동역학을 분석한다.
  • 이론적 분석을 통해 적절한 정규화 하에 Adam과 GD가 다항 시간 내에 영점의 훈련 오차로 전역 수렴함을 증명한다.
  • 학습된 가중치 벡터를 비교하여, GD는 진짜 특징 패치에 집중하는 반면, Adam은 노이즈 패치에 과적합됨을 보여준다.
  • 저자는 볼록 설정에서 정규화가 있을 경우 Adam과 GD가 동일한 유일한 해로 수렴함을 증명한다. 이는 비볼록 설정과는 다름을 의미한다.
  • 확률적 및 고확률 경계를 사용하여 두 최적화 방법 간의 일반화 오차 차이를 설정한다.

실험 결과

연구 질문

  • RQ1정규화를 적용함에도 불구하고 딥러닝에서 Adam이 GD보다 일반화 성능이 떨어지는 이유는 무엇인가?
  • RQ2오버파라미터화된 신경망의 손실 지형의 비볼록성으로 인해 Adam과 GD 간의 일반화 격차가 설명될 수 있는가?
  • RQ3훈련 목적이 볼록이고 정규화가 있을 경우, Adam과 GD는 동일한 해로 수렴하는가?
  • RQ4왜 Adam은 노이즈 패치에 과적합하는 반면, GD는 데이터의 의미 있는 특징을 학습하는가?
  • RQ5Adam의 열악한 일반화 성능은 본질적으로 비볼록 최적화에 기인하는가, 아니면 정규화로 해결될 수 있는가?

주요 결과

  • 오버파라미터화된 두 층의 CNN에서 비볼록 설정에서도 동일한 초기화와 가중치 감쇠 정규화를 적용함에도 불구하고, Adam과 GD는 서로 다른 전역 최적해로 수렴한다.
  • GD는 진짜 특징 패치를 학습하여 거의 영점의 테스트 오차를 달성하지만, Adam은 노이즈 패치에 과적합되어 무작위 추측과 비슷한 성능을 보인다.
  • 일반화 격차는 Adam이 데이터의 노이즈에 더 민감하여 노이즈 성분이 지배하는 해로 수렴하기 때문에 발생한다.
  • 볼록 설정에서 가중치 감쇠를 적용할 경우, Adam과 GD는 동일한 유일한 해로 수렴하므로, 이 격차의 근본 원인은 비볼록성에 기인한다.
  • 이론적 분석을 통해 Adam과 GD 모두 다항 시간 내에 영점의 훈련 오차를 달성하지만, 서로 다른 최적화 경로로 인해 일반화 성능이 갈린다.
  • 결과적으로 정규화만으로는 비볼록 딥러닝 환경에서 Adam과 GD 간의 일반화 격차를 해소할 수 없다는 것이 입증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.