Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Landscape Analysis in Deep Neural Networks: Eliminating Decreasing Paths to Infinity

Shiyu Liang, Ruoyu Sun|arXiv (Cornell University)|2019. 12. 31.
Stochastic Gradient Optimization Techniques참고 문헌 64인용 수 11
한 줄 요약

이 논문은 과다 파rameter화된 딥 네URAL 네트워크를 위한 새로운 랜드스케이프 분석 프레임워크를 제안하며, 동시에 열악한 국소 최소값과 무한으로 향하는 감소 경로를 제거하는 종합적인 정규화 항을 도입한다. 리프시츠 사상에 의해 부적절한 정규화 항이 영도수를 가진 집합임을 보여줌으로써, 저자들은 과다 파arameter화된 네트워크의 광범위한 클래스에서 경사하강법이 영훈도 훈련 오차를 가진 전역 최소값으로 수렴함을 증명하며, 딥 러닝 최적화 이론의 핵심적 격차를 해결한다.

ABSTRACT

Traditional landscape analysis of deep neural networks aims to show that no sub-optimal local minima exist in some appropriate sense. From this, one may be tempted to conclude that descent algorithms which escape saddle points will reach a good local minimum. However, basic optimization theory tell us that it is also possible for a descent algorithm to diverge to infinity if there are paths leading to infinity, along which the loss function decreases. It is not clear whether for non-linear neural networks there exists one setting that no bad local-min and no decreasing paths to infinity can be simultaneously achieved. In this paper, we give the first positive answer to this question. More specifically, for a large class of over-parameterized deep neural networks with appropriate regularizers, the loss function has no bad local minima and no decreasing paths to infinity. The key mathematical trick is to show that the set of regularizers which may be undesirable can be viewed as the image of a Lipschitz continuous mapping from a lower-dimensional Euclidean space to a higher-dimensional Euclidean space, and thus has zero measure.

연구 동기 및 목표

  • 딥 네URAL 네트워크 랜드스케이프에서 악성 국소 최소값이 없음에도 불구하고 내림내림 알고리즘이 무한으로 발산할 수 있다는 미해결 문제를 다루기 위해.
  • 딥 네URAL 네트워크에서 '나쁜 국소 최소값이 없음'과 '무한으로 향하는 감소 경로가 없음'이 동시에 존재하는 조건을 공식적으로 수립하기 위해.
  • 적절한 정규화 항을 가진 과다 파arameter화된 네트워크에서 경사하강법이 전역 최소값으로 수렴하고 영훈도 훈련 오차를 달성함을 증명하기 위해.
  • 문제가 되는 정규화 항의 집합이 무시할 수 있을 정도로 작음(영도수)을 보여주어 일반적인 네트워크 구성에서의 강건성을 확보하기 위해.

제안 방법

  • 모든 가중치 파aram터에 삼차 정규화 항을 도입하여 파aram터 공간을 제약하고 무한으로 향하는 발산을 방지한다.
  • 낮은 차원의 공간에서 연속적인 리프시츠 사상으로 악성 정규화 항의 집합을 특성화하여, 이들이 파aram터 공간에서 영도수를 가짐을 증명한다.
  • 이 정규화된 손실 함수 하에서의 임의의 국소 최소값이 영훈도 훈련 오차를 가져야 하며, 따라서 전역 최적임을 증명한다.
  • 과다 파arameter화를 활용하여 보간 솔루션의 존재를 보장하고 열악한 최소값을 피한다.
  • ReLU 네트워크를 사용한 구성적 보간 추론을 적용하여 데이터가 양의 마진을 가진 채로 완벽하게 피팅 가능함을 보여주며, 랜드스케이프 분석을 가능하게 한다.
  • 변형 기법을 통해 손실 랜드스케이프를 분석하여, 활성화 노름이 0인 임의의 임계점은 국소 최소값이 아니라 안장점임을 보여준다.

실험 결과

연구 질문

  • RQ1딥 네URAL 네트워크의 손실 랜드스케이프가 동시에 열악한 국소 최소값이 없고 무한으로 향하는 감소 경로가 없는가?
  • RQ2무한으로 향하는 경로를 제거하면서 새로운 악성 국소 최소값을 도입하지 않는 정규화 항을 설계할 수 있는가?
  • RQ3과다 파arameter화된 딥 네트워크에 이러한 정규화 항을 적용하면 경사하강법이 전역 최소값으로 수렴하는가?
  • RQ4원하는 랜드스케이프 성질을 해칠 수 있는 정규화 항의 측도 이론적 성격은 무엇인가?

주요 결과

  • 모든 가중치에 삼차 정규화 항을 적용한 과다 파arameter화된 딥 네트워크의 광범위한 클래스에서 손실 함수는 열악한 국소 최소값이 존재하지 않는다.
  • 악성 국소 최소값이나 무한으로 향하는 감소 경로를 유도할 수 있는 정규화 항의 집합은 파aram터 공간에서 영도수를 가지며, 따라서 무시할 수 있다.
  • 정규화된 손실 함수 하에서의 모든 국소 최소값은 영훈도 훈련 오차를 달성하므로 전역 최적임을 의미한다.
  • 모든 가중치 파aram터에 대한 정규화 항의 제약으로 인해 무한으로 향하는 감소 경로의 존재가 제거되어 발산이 방지된다.
  • 크기가 n+1인 단일층 ReLU 네트워크는 약한 가정 하에서 임의의 데이터셋을 보간할 수 있으며, 이는 전역 최적 랜드스케이프의 구축을 가능하게 한다.
  • 이론적 분석을 통해 은닉층 가중치의 노름이 0인 임계점은 국소 최소값이 아니라 안장점임을 확인하여 열악한 해를 피할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.