Skip to main content
QUICK REVIEW

[논문 리뷰] Direction Matters: On the Implicit Bias of Stochastic Gradient Descent with Moderate Learning Rate

Jingfeng Wu, Difan Zou|arXiv (Cornell University)|2020. 11. 04.
Stochastic Gradient Optimization Techniques참고 문헌 48인용 수 6
한 줄 요약

이 논문은 중간 크기의 학습률을 사용할 때 확률적 경사 하강법(SGD)가 데이터 행렬의 큰 고유값 방향으로 수렴하는 특별한 방향성 편향을 보임을 밝혀내며, 이는 경사 하강법(GD)이 작은 고유값 방향을 선호하는 것과 대조된다. 이러한 편향은 조기 정지 조건 하에서 더 나은 일반화 성능을 이끌어내며, 실용적인 SGD의 이점과 선형 배치 크기 스케일링과 같은 하이퍼파rameter 튜닝 관행을 설명한다.

ABSTRACT

Understanding the algorithmic bias of \\emph{stochastic gradient descent} (SGD) is one of the key challenges in modern machine learning and deep learning theory. Most of the existing works, however, focus on \\emph{very small or even infinitesimal} learning rate regime, and fail to cover practical scenarios where the learning rate is \\emph{moderate and annealing}. In this paper, we make an initial attempt to characterize the particular regularization effect of SGD in the moderate learning rate regime by studying its behavior for optimizing an overparameterized linear regression problem. In this case, SGD and GD are known to converge to the unique minimum-norm solution; however, with the moderate and annealing learning rate, we show that they exhibit different \\emph{directional bias}: SGD converges along the large eigenvalue directions of the data matrix, while GD goes after the small eigenvalue directions. Furthermore, we show that such directional bias does matter when early stopping is adopted, where the SGD output is nearly optimal but the GD output is suboptimal. Finally, our theory explains several folk arts in practice used for SGD hyperparameter tuning, such as (1) linearly scaling the initial learning rate with batch size; and (2) overrunning SGD with high learning rate even when the loss stops decreasing.

연구 동기 및 목표

  • 작은 학습률 이론이 실용적 이점을 설명하지 못하는 중간 크기의 학습률 영역에서 SGD의 암묵적 편향을 규명하는 것.
  • 오버파라미터라이제이션 선형 회귀에서 SGD와 GD의 수렴 방향을 비교하여, 서로 다른 방향성 선호도를 드러내는 것.
  • 조기 정지를 적용했을 때 SGD가 실질적으로 GD보다 더 잘 일반화되는 이유를 설명하는 것.
  • 학습률을 배치 크기와 선형적으로 스케일링하는 것과 같은 일반적인 SGD 하이퍼파rameter 튜닝 관행에 대한 이론적 근거를 제공하는 것.

제안 방법

  • 중간 크기의 학습률과 점차 감소하는 학습률을 사용하여 오버파라미터라이제이션 선형 회귀를 분석한다.
  • 데이터 행렬의 고유분해를 통해 수렴 방향 행동을 유도하며, SGD는 큰 고유값을 선호하고 GD는 작은 고유값을 선호함을 보여준다.
  • 비볼록 신경망에서 수렴 방향을 비교하기 위해 상대 레일리 몫을 사용하며, 헤시안의 연산자 노름으로 정규화한다.
  • 신경망 실험에서 상대 레일리 몫 계산을 위해 최대 헤시안 고유값을 추정하기 위해 파wer 메서드를 활용한다.
  • 합성 및 실질 데이터셋(FashionMNIST 등)을 대상으로 다양한 학습률과 배치 크기 하에서 SGD와 GD를 비교하는 실험적 평가를 수행한다.
  • 10회의 반복 실험을 기반으로 성능 차이의 통계적 유의성을 검증하기 위해 대응 t-검정을 실시한다.

실험 결과

연구 질문

  • RQ1오버파라미터라이제이션 선형 회귀에서 중간 크기의 학습률을 사용할 때 SGD는 GD와 어떻게 다른 수렴 방향을 보이는가?
  • RQ2조기 정지를 적용했을 때, 둘 다 최소 노름 해로 수렴하는데도 불구하고 SGD가 왜 GD보다 더 잘 일반화되는가?
  • RQ3중간 크기의 학습률을 가진 SGD의 방향성 편향은 실질적인 딥러닝 환경에서 일반화에 어떤 영향을 미치는가?
  • RQ4학습률을 배치 크기와 선형적으로 스케일링하는 일반적인 SGD 하이퍼파rameter 튜닝 관행의 이론적 근거는 무엇인가?

주요 결과

  • 중간 크기의 학습률을 가진 SGD는 데이터 행렬의 큰 고유값 방향으로 수렴하는 반면, GD는 작은 고유값 방향으로 수렴한다.
  • 조기 정지 조건 하에서 SGD의 방향성 편향은 GD보다 유의미하게 높은 테스트 정확도를 이끌어내며, 대응 t-검정에서 p-값은 0.0043이다.
  • FashionMNIST에서 중간 크기의 학습률을 가진 SGD는 평균 82.65%의 테스트 정확도를 기록하여, GD(81.83%)와 작은 학습률을 가진 SGD(81.77%)를 모두 앞서간다.
  • 이 방향성 편향은 SGD가 정규화 없이도 실질적으로 GD보다 더 잘 일반화되는 이유를 설명한다.
  • 이론적 분석은 학습률을 배치 크기와 선형적으로 스케일링하는 관행이 유지되는 이유를 뒷받침하며, 동일한 수렴 방향 편향을 유지하기 때문이다.
  • 손실의 정체 단계를 넘어서 높은 학습률로 SGD를 계속 실행하면 일반화 성능이 향상되며, 이는 방향성 편향 효과와 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.