Skip to main content
QUICK REVIEW

[논문 리뷰] Depth creates no more spurious local minima

Li Zhang|arXiv (Cornell University)|2019. 01. 28.
Stochastic Gradient Optimization Techniques참고 문헌 18인용 수 12
한 줄 요약

이 논문은 임의의 볼록 미분 가능 손실 함수에 대해, 깊이 있는 선형 신경망이 비근본적인 국소 최솟값을 가지지 않기 위한 필요충분조건이, 해당하는 두 레이어 선형 신경망이 비근본적인 국소 최솟값을 가지지 않는 것임을 증명한다. 이는 깊이 있는 신경망의 분석을 더 단순한 두 레이어 케이스로 환원한다. 핵심 기여는 비근본적인 국소 최솟값이 반드시 전순위를 가져야 한다는 새로운 변형 분석을 통해 이를 입증한 것으로, 이는 환원 가능성을 보장하고, 제곱 손실에 대해 비근본적인 최솟값이 존재하지 않음을 조건 없이 증명하는 데 기여한다.

ABSTRACT

We show that for any convex differentiable loss, a deep linear network has no spurious local minima as long as it is true for the two layer case. This reduction greatly simplifies the study on the existence of spurious local minima in deep linear networks. When applied to the quadratic loss, our result immediately implies the powerful result in [Kawaguchi 2016]. Further, with the work in [Zhou and Liang 2018], we can remove all the assumptions in [Kawaguchi 2016]. This property holds for more general "multi-tower" linear networks too. Our proof builds on [Laurent and von Brecht 2018] and develops a new perturbation argument to show that any spurious local minimum must have full rank, a structural property which can be useful more generally.

연구 동기 및 목표

  • 깊이 있는 선형 신경망에서 깊이가 비근본적인 국소 최솟값을 추가로 유도하는지 여부에 대한 열린 문제를 해결하기 위해.
  • 깊이 있는 선형 신경망에서 비근본적인 국소 최솟값의 분석을 두 레이어 케이스로 환원하여 단순화하기 위해.
  • 비근본적인 국소 최솟값이 반드시 전순위를 가져야 한다는 비퇴화 성질을 규명하고, 깊이 있는 신경망을 초월한 응용 가능성을 확보하기 위해.
  • 결과를 다중타워 선형 신경망으로 확장하고, 이전 연구에서 제시된 제곱 손실에 대한 가정을 제거하기 위해.

제안 방법

  • 깊이 있는 선형 신경망에서 비근본적인 국소 최솟값이 반드시 전순위를 가져야 한다는 새로운 랭크-일 변형 분석 기법을 제안한다.
  • 망막 레이어에서 네트워크를 분할함으로써 깊이 있는 신경망의 비근본적인 최솟값 문제를 두 레이어 케이스로 환원한다.
  • 변형 기법을 적용하여 깊이 있는 신경망의 비근본적인 임계점이 두 레이어 설정으로 국소적으로 환원될 수 있음을 보여준다.
  • 전순위 성질을 활용해 이전 연구에서 복잡한 분석이 필요로 했던 랭크-결손 케이스를 제거한다.
  • 각 타워를 슈퍼-레이어로 간주하고 동일한 환원 원칙을 적용함으로써 다중타워 선형 신경망으로 결과를 확장한다.
  • 기존의 두 레이어 신경망 결과(예: [19])를 활용하여 제약 조건 없이 제곱 손실에 대해 비근본적인 최솟값이 존재하지 않음을 조건 없이 증명한다.

실험 결과

연구 질문

  • RQ1깊이 있는 선형 신경망에서 깊이가 두 레이어 신경망에 존재하는 것 외에 추가로 비근본적인 국소 최솟값을 생성하는가?
  • RQ2임의의 볼록 미분 가능 손실 함수에 대해, 깊이 있는 선형 신경망에서 비근본적인 국소 최솟값의 존재 여부를 두 레이어 케이스로 환원할 수 있는가?
  • RQ3깊이 있는 선형 신경망에서 비근본적인 국소 최솟값이 반드시 만족해야 할 구조적 성질은 무엇인가?
  • RQ4깊이 있는 선형 신경망에서 제곱 손실에 대해 비근본적인 국소 최솟값이 존재하지 않음을 제한 조건 없이 증명할 수 있는가?
  • RQ5환원 원칙은 다중타워 선형 신경망으로도 확장 가능한가?

주요 결과

  • 임의의 볼록 미분 가능 손실 함수에 대해, 깊이 있는 선형 신경망이 비근본적인 국소 최솟값을 가지지 않기 위한 필요충분조건은 해당하는 두 레이어 선형 신경망이 비근본적인 국소 최솟값을 가지지 않는 것이다.
  • 깊이 있는 선형 신경망의 모든 비근본적인 국소 최솟값은 반드시 전순위를 가져야 하며, 이는 분석을 단순화하는 비퇴화 성질이다.
  • 이 결과는 제곱 손실에 대해 깊이 있는 선형 신경망에서 비근본적인 최솟값이 존재하지 않음을 조건 없이 증명함으로써, 이전 연구들(예: Kawaguchi, 2016)의 가정을 제거한다.
  • 다중타워 선형 신경망의 경우, 타워의 막힘 레이어를 합친 결과로 형성되는 두 레이어 신경망의 비근본적인 최솟값 여부에 따라 전체 네트워크의 비근본성 여부가 결정된다.
  • 합쳐진 막힘 크기 $b$ 가 $b \geq \max(m,n)$ 를 만족할 경우, 다중타워 네트워크는 비근본적인 국소 최솟값이 존재하지 않는다.
  • 새로운 변형 분석 기반의 증명 기법은 첨단 수학적 도구를 피하고, Laurent 및 von Brecht(2017)의 접근 방식을 막힘 레이어를 가진 네트워크로 일반화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.