Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit Regularization and Convergence for Weight Normalization

Xiaoxia Wu, Edgar Dobriban|arXiv (Cornell University)|2019. 11. 18.
Sparse and Compressive Sensing Techniques참고 문헌 69인용 수 5
한 줄 요약

이 논문은 과다매개변수화된 최소제곱 회귀에서 가중치 정규화(WN)와 그 변종인 재매개변수화된 투영된 경사하강법(rPGD)을 연구하며, 초기화에 관계없이 항상 최소 $̂²$ 노름 해에 가까운 해로 수렴함으로써 암묵적 정규화를 유도한다는 것을 보여준다. 표준 경사하강법과 달리, 초기화가 0이 아닐 경우에도 WN과 rPGD는 가중치를 척도와 방향 성분으로 분리하는 비볼록 재매개변수화 덕분에 안정적인 수렴을 유지한다.

ABSTRACT

Normalization methods such as batch [Ioffe and Szegedy, 2015], weight [Salimansand Kingma, 2016], instance [Ulyanov et al., 2016], and layer normalization [Baet al., 2016] have been widely used in modern machine learning. Here, we study the weight normalization (WN) method [Salimans and Kingma, 2016] and a variant called reparametrized projected gradient descent (rPGD) for overparametrized least-squares regression. WN and rPGD reparametrize the weights with a scale g and a unit vector w and thus the objective function becomes non-convex. We show that this non-convex formulation has beneficial regularization effects compared to gradient descent on the original objective. These methods adaptively regularize the weights and converge close to the minimum l2 norm solution, even for initializations far from zero. For certain stepsizes of g and w , we show that they can converge close to the minimum norm solution. This is different from the behavior of gradient descent, which converges to the minimum norm solution only when started at a point in the range space of the feature matrix, and is thus more sensitive to initialization.

연구 동기 및 목표

  • 과다매개변수화된 모델에서 가중치 정규화(WN)와 재매개변수화된 투영된 경사하강법(rPGD)의 암묵적 정규화 효과를 이해하는 것.
  • WN과 rPGD가 초기화가 0이 아니어도 최소 $̂²$ 노름 해에 가까운 해로 수렴하는 방식을 규명하는 것.
  • 표준 경사하강법(GD)과의 수렴 행동을 비교하며, 초기화에 대한 민감도를 분석하는 것.
  • WN과 rPGD가 기하수렴 속도를 확보하고 최소 노름 해에 접근할 수 있는 이론적 조건을 설정하는 것.
  • 스텝사이즈 스케줄링과 재매개변수화의 역할이 강건한 암묵적 정규화를 어떻게 달성하는지 조사하는 것.

제안 방법

  • 가중치 행렬 $x$를 $x = g w / \|w\|_2$로 재매개변수화하며, 여기서 $g \in \mathbb{R}$는 척도이고 $w \in \mathbb{R}^d$는 방향 벡터이다. 이는 원래의 볼록 최소제곱 문제를 비볼록 최적화 문제로 변환한다.
  • rPGD를 제안하며, 단위 노름 방향 $w$에 대해 투영된 경사하강법을 수행하면서 척도 $g$를 갱신함으로써 매 단계에서 $\|w\|_2 = 1$을 유지한다.
  • WN과 rPGD의 연속시간 근사값을 분석하여, 적절한 스텝사이즈 스케일링 하에 동일한 플로우로 수렴함을 보이며, 이를 WN 플로우로 부른다.
  • 재매개변수화로 인해 임의의 정류점이 발생하지만, 척도 매개변수 $g$를 적절히 제어할 경우 손실이 기하급수적으로 감소함을 입증한다.
  • 두 단계 학습률 스케줄링—초기에는 $g$와 $w$를 모두 갱신하고, 이후에는 $g$만 갱신—을 통해 다양한 초기화 조건에서 최소 노름 해로의 수렴을 향상시킨다.
  • 행렬 감지 문제에서 실험을 수행하여, 일정한 학습률과 두 단계 학습률을 사용할 때 GD, WN, rPGD의 최종 해의 핵노름을 비교한다.

실험 결과

연구 질문

  • RQ1표준 경사하강법과 달리, 초기화가 0에서 멀리 떨어져 있어도 가중치 정규화(WN)와 rPGD가 최소 $̂²$ 노름 해로 수렴하는가?
  • RQ2WN과 rPGD의 비볼록 재매개변수화가 최적화 경로와 수렴 행동에 어떤 영향을 미치는가?
  • RQ3WN과 rPGD의 연속시간 근사값 간의 관계는 무엇이며, 이는 암묵적 정규화와 어떻게 관련되는가?
  • RQ4두 단계 학습률 스케줄링이 다양한 초기화 조건에서 최소 노름 해로의 수렴을 향상시키는가?
  • RQ5과다매개변수화된 최소제곱 문제에서 WN과 rPGD가 표준 경사하강법과 비교해 최종 해의 노름과 초기화에 대한 강건성 측면에서 어떻게 다른가?

주요 결과

  • 표준 경사하강법이 0으로 초기화된 경우에만 최소 $̂²$ 노름 해로 수렴하는 데 반해, WN과 rPGD는 다양한 초기화 조건에서도 최소 $̂²$ 노름 해에 가까운 해로 수렴한다.
  • WN과 rPGD의 연속시간 근사값은 동일하며, 이를 WN 플로우로 부르며, 작은 스텝사이즈에서의 한계에서 두 방법이 동치임을 입증한다.
  • 비볼록 형태에서 국소 최적점이 존재하지만, 척도 매개변수 $g$를 적절히 제어할 경우 손실이 기하급수적으로 감소함을 보였다.
  • 두 단계 학습률 스케줄링—초기 단계에서 $g$와 $w$를 갱신하고, 이후에는 $g$만 갱신—은 다양한 초기 척도 값 $g_0$에 걸쳐 최소 핵노름 해에 더 가까운 해로 수렴하게 한다.
  • 행렬 감지 실험에서, 특히 두 단계 학습률을 사용할 경우 WN과 rPGD가 표준 GD보다 더 넓은 초기화 범위에서 더 작은 핵노름을 가진 해로 수렴함을 확인하였다.
  • 실험 결과 WN과 rPGD의 최종 해 노름이 매우 유사하게 겹치며, 이는 연속한 극한에서 이론적으로 동치임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.