Skip to main content
QUICK REVIEW

[논문 리뷰] Avoiding Spurious Local Minima in Deep Quadratic Networks

Abbas Kazemipour, Brett W. Larsen|arXiv (Cornell University)|2019. 12. 31.
Stochastic Gradient Optimization Techniques참고 문헌 38인용 수 4
한 줄 요약

이 논문은 과다 파rameter화된 경우, 딥 퀴드라틱 신경망이 손실 곡면에서 유사 국소 최소값을 피함을 입증하며, 미세한 조건 하에 경사하강법이 확률적으로 전역 최소값으로 수렴함을 보였다. 입력 노름을 회귀자로 추가하거나 구조적 정규화를 사용하면, d차원 입력에 대해 최소 d개의 뉴런을 가진 두층 네트워크에서도 가짜 정류점에서 벗어날 수 있음을 보여주었다.

ABSTRACT

Despite their practical success, a theoretical understanding of the loss landscape of neural networks has proven challenging due to the high-dimensional, non-convex, and highly nonlinear structure of such models. In this paper, we characterize the training landscape of the mean squared error loss for neural networks with quadratic activation functions. We prove existence of spurious local minima and saddle points which can be escaped easily with probability one when the number of neurons is greater than or equal to the input dimension and the norm of the training samples is used as a regressor. We prove that deep overparameterized neural networks with quadratic activations benefit from similar nice landscape properties. Our theoretical results are independent of data distribution and fill the existing gap in theory for two-layer quadratic neural networks. Finally, we empirically demonstrate convergence to a global minimum for these problems.

연구 동기 및 목표

  • 평균 제곱오차 손실을 사용하는 딥 퀴드라틱 신경망의 손실 곡면을 이론적으로 특성화하는 것.
  • 기존 이론의 격차를 해소하기 위해, 데이터 분포에 관계없이 k ≥ d개의 뉴런을 가진 두층 퀴드라틱 네트워크에 대해 전역 수렴을 증명하는 것.
  • 과다 파arameter화와 특정 정규화 전략이 유사 국소 최소값과 안장점들을 제거함을 보여주는 것.
  • 딥 퀴드라틱 네트워크에서 경사하강법이 전역 최소화자로 수렴할 조건을 설정하는 것, 특히 비볼록 고차원 환경에서도 적용 가능하도록.

제안 방법

  • ReLU 유사 퀸드라틱 활성함수를 가진 두층 및 딥 퀴드라틱 신경망에서 평균 제곱오차 손실 함수를 분석한다.
  • 입력 샘플의 L2 노름을 명시적 회귀자로 추가하여 데이터 정규화를 도입함으로써 유사 국소 최소값에서 벗어나도록 한다.
  • 분해 행렬에 프로베니우스 노름 페널티를 적용하여 전체 질량 해를 강제하고 낮은 질량 해에서의 함정을 피한다.
  • 특성분해 및 텐서 분해 이론을 활용하여, 전체 질량 조건 하에서 최적화 문제를 가중치 공간에서 볼록 문제로 재구성한다.
  • 임의의 스텝 크기로 경사하강법을 적용하며, 네트워크가 과다 파arameter화되어 있고 적절하게 초기화된 경우 전역 최소값으로 수렴함을 증명한다.
  • k = binom(d+p-1, d-1)개의 뉴런과 적절한 초기화 조건 하에서, 고차 다항식 네트워크(PL 네트워크)로 결과를 일반화한다.

실험 결과

연구 질문

  • RQ1두층 퀴드라틱 신경망이 손실 곡면에서 유사 국소 최소값을 피하는 조건은 무엇인가요?
  • RQ2뉴런 수가 입력 차원과 동일한 d개일 경우, 경사하강법이 퀴드라틱 네트워크에서 전역 최소값으로 수렴할 수 있나요?
  • RQ3특히 입력 노름을 회귀자로 추가함으로써 데이터 정규화가 유사 정류점에서의 탈출에 어떤 영향을 미치나요?
  • RQ4정규화는 대칭 행렬 분해에서 퀴드라틱 네트워크의 유사 해를 제거하는 데 어떤 역할을 하나요?
  • RQ5과다 파arameter화된 딥 퀴드라틱 네트워크는 두층 네트워크의 유리한 최적화 성질을 이어받을 수 있나요?

주요 결과

  • k ≥ d개의 뉴런을 가진 두층 퀴드라틱 네트워크에서, 입력 노름을 회귀자로 사용할 경우 경사하강법이 유사 국소 최소값과 안장점에서 확률적으로 벗어나며, 전역 최소값으로 수렴한다.
  • 이론적 결과는 데이터 분포와 독립적이며, 이전 연구에서 제기된 제약 조건을 제거한다.
  • 과다 파arameter화된 딥 퀴드라틱 네트워크는 유사 정류점이 존재하지 않으며, 이로 인해 경사하강법으로 전역 수렴이 가능하다.
  • k = d일 경우, 학습은 이차 특징을 가진 최소 제곱 문제로 축소되며, 고유분해를 통해 해결할 수 있다.
  • 고차 다항식 네트워크(p > 2)의 경우, k = binom(d+p-1, d-1)개의 뉴런과 적절한 초기화 조건 하에서 전역 수렴이 보장된다.
  • 분석에서 사용된 정규화 페널티는 전체 질량 분해를 보장하며, 유사 최소값으로 이어질 수 있는 낮은 질량 해를 피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.