Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit Bias of Gradient Descent for Two-layer ReLU and Leaky ReLU Networks on Nearly-orthogonal Data

Yiwen Kou, Zixiang Chen|arXiv (Cornell University)|2023. 10. 29.
Machine Learning and ELM인용 수 4
한 줄 요약

이 논문은 거의 직교적인 데이터에서 두 계층 ReLU 및 Leaky ReLU 네트워크에서 경사하강법의 암묵적 편향을 규명하며, Leaky ReLU의 경우 경사하강법이 안정적 랭크 1인 해로 수렴함을 증명하고, ReLU의 경우 안정적 랭크가 유계임을 보이며, 모든 학습 예제가 점점 더 같은 정규화된 마진을 갖게 된다. 분석을 통해 로그 척도의 가중치 노름 증가와 $\Theta(t^{-1})$ 손실 수렴 속도를 규명하였으며, 이는 이전의 경사 유동 결과를 비연속 네트워크에서 경사하강법으로 확장한 것이다.

ABSTRACT

The implicit bias towards solutions with favorable properties is believed to be a key reason why neural networks trained by gradient-based optimization can generalize well. While the implicit bias of gradient flow has been widely studied for homogeneous neural networks (including ReLU and leaky ReLU networks), the implicit bias of gradient descent is currently only understood for smooth neural networks. Therefore, implicit bias in non-smooth neural networks trained by gradient descent remains an open question. In this paper, we aim to answer this question by studying the implicit bias of gradient descent for training two-layer fully connected (leaky) ReLU neural networks. We showed that when the training data are nearly-orthogonal, for leaky ReLU activation function, gradient descent will find a network with a stable rank that converges to $1$, whereas for ReLU activation function, gradient descent will find a neural network with a stable rank that is upper bounded by a constant. Additionally, we show that gradient descent will find a neural network such that all the training data points have the same normalized margin asymptotically. Experiments on both synthetic and real data backup our theoretical findings.

연구 동기 및 목표

  • 비연속 신경망, 특히 ReLU 및 Leaky ReLU 네트워크에서 경사하강법의 암묵적 편향을 이해하는 것. 이 편향은 아직 잘 이해되지 않은 분야이다.
  • 학습 데이터가 거의 직교적일 때, 경사하강법이 두 계층 완전 연결 네트워크를 어떻게 최적화하는지 분석하는 것. 이 조건은 이론적 접근 가능성을 제공한다.
  • ReLU 및 Leaky ReLU 활성화 함수를 사용할 때, 경사하강법 하에서 가중치 행렬의 수렴 성질, 즉 안정적 랭크와 정규화된 마진을 규명하는 것.
  • 기존의 경사 유동 결과를 비연속 설정으로 확장하고, 특히 비연속 환경에서 경사하강법에 대한 엄밀한 이론적 보장을 제공하는 것.

제안 방법

  • 거의 직교적인 데이터 $\|\mathbf{x}_i\|_2^2 \geq Cn \max_{k \neq i} |\langle \mathbf{x}_i, \mathbf{x}_k \rangle|$ 를 가진 두 계층 ReLU 및 Leaky ReLU 네트워크에서 경사하강법의 동역학에 대한 이론적 분석.
  • 신경망의 활성화 패tern과 가중치 행렬의 진화를 분석하여 Leaky ReLU 네트워크에서 안정적 랭크가 1로 수렴하고, ReLU 네트워크에서 안정적 랭크가 유계임을 증명.
  • 미분 부등식 기법과 로그 적분을 사용하여 가중치 노름 증가 속도 $\Theta(\log t)$ 와 손실 감소 속도 $\Theta(t^{-1})$ 를 유도.
  • 손실 함수의 성질과 기울기 역학을 활용하여 모든 학습 데이터 포인트가 점차 동일한 정규화된 마진을 갖게 되는 것을 증명.
  • 수렴 분석에서 핵심 항을 유계로 만드는 데 사용된 서브가우시안 행렬 농도(보조정리 H.3)와 로그 부등식 보조정리(H.4, H.5)의 적용.
  • 로그arithmic 가중치 노름의 성장과 수렴 속도 유도를 위한 미분 부등식 기법의 적용(Lemmas H.1 및 H.2).

실험 결과

연구 질문

  • RQ1거의 직교적인 데이터에서 훈련된 두 계층 ReLU 및 Leaky ReLU 네트워크에서 경사하강법의 암묵적 편향은 무엇인가?
  • RQ2ReLU 및 Leaky ReLU 네트워크에서 경사하강법 동안 가중치 행렬의 안정적 랭크는 어떻게 변화하는가?
  • RQ3경사하강법은 이러한 네트워크에서 모든 학습 샘플이 점차 동일한 정규화된 마진을 갖게 하는가?
  • RQ4이러한 비연속 네트워크에서 경사하강법 하에서 가중치 노름과 훈련 손실의 수렴 속도는 무엇인가?
  • RQ5이론적 결과는 동일한 설정에서 기존의 경사 유동 분석과 어떻게 비교되는가?

주요 결과

  • 두 계층 Leaky ReLU 네트워크의 경우, 경사하강법이 가중치 행렬의 안정적 랭크를 1로 수렴시켜 Frei 등(2022b)의 경사 유동 결과와 일치한다.
  • 두 계층 ReLU 네트워크의 경우, 가중치 행렬의 안정적 랭크는 상수로 유계이며, 완전히 직교적인 데이터에서 수렴값이 약 2임을 보여주는 예시가 제시된다.
  • 경사하강법은 반복 횟수 $t$ 에 대해 $\Theta(\log t)$ 속도로 가중치 노름을 증가시킨다.
  • 훈련 손실은 $\Theta(t^{-1})$ 속도로 0으로 수렴하며, 이는 이전 연구에서의 매끄러운 네트워크의 $O(t^{-1/2})$ 속도를 향상시킨다.
  • 모든 학습 데이터 포인트가 점차 동일한 정규화된 마진을 갖게 되어, 최대 마진 해로 수렴함을 나타낸다.
  • 이론적 결과는 합성 및 실제 데이터셋 모두에서 실험적으로 검증되었으며, 예측된 수렴 행동을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.