Skip to main content
QUICK REVIEW

[논문 리뷰] Elimination of All Bad Local Minima in Deep Learning

Kenji Kawaguchi, Leslie Pack Kaelbling|arXiv (Cornell University)|2019. 01. 02.
Sparse and Compressive Sensing Techniques참고 문헌 32인용 수 38
한 줄 요약

저자들은 출력 단위당 하나의 뉴런을 추가하는 것이 실용적인 손실 가정 하에 어떤 심층 네트워크에서든 모든 서브옵티멈 로컬 미니멈을 제거하고, 로컬 미니멈에서 추가 뉴런의 효과가 사라지며, PGB 기반 분석을 도입한다는 것을 보인다.

ABSTRACT

In this paper, we theoretically prove that adding one special neuron per output unit eliminates all suboptimal local minima of any deep neural network, for multi-class classification, binary classification, and regression with an arbitrary loss function, under practical assumptions. At every local minimum of any deep neural network with these added neurons, the set of parameters of the original neural network (without added neurons) is guaranteed to be a global minimum of the original neural network. The effects of the added neurons are proven to automatically vanish at every local minimum. Moreover, we provide a novel theoretical characterization of a failure mode of eliminating suboptimal local minima via an additional theorem and several examples. This paper also introduces a novel proof technique based on the perturbable gradient basis (PGB) necessary condition of local minima, which provides new insight into the elimination of local minima and is applicable to analyze various models and transformations of objective functions beyond the elimination of local minima.

연구 동기 및 목표

  • 딥 네트워크에서의 나쁜 로컬 미니멈의 문제를 동기 부여하고 과도한 매개파라메트릭화(over-parameterization) 너머의 이론적 보장을 모색한다.
  • 모든 하위 최적의 로컬 미니멈을 제거하는 최소한의 구조적(아키텍처) 수정 제안.
  • 임의의 로컬 미니멈에서 원래 네트워크 매개변수들이 기본 목적함수의 전역 최솟값을 달성함을 증명한다.
  • 로컬 미니멈 제거의 실패 모드를 특성화하고 이 문제를 넘어 적용 가능한 새로운 증명 기법(PGB)을 도입한다.

제안 방법

  • 추가된 가중치에 대한 정규화항과 지수 형태를 갖는 출력 단위당 하나의 뉴런을 추가하여 보조 목적함수를 정의한다.
  • 보조 목적의 로컬 미니멈이 원래 네트워크의 전역 최적임을 의미한다.
  • PGB(perturbable gradient basis) 필요조건을 이용해 제거 결과를 도출한다.
  • 실현 가능한 데이터 가정에 대한 약한 조건도 논의한다.
  • 실패 모드를 특성화하고 그것이 gradient 기반 최적화에 주는 함의를 논의한다.

실험 결과

연구 질문

  • RQ1단 하나의 최소한의 아키텍처 변화가 다양한 태스크와 손실에 걸쳐 모든 나쁜 로컬 미니멈의 제거를 보장할 수 있는가?
  • RQ2이 제거가 성립하려면 어떤 가정이 필요하며 최적점에서 추가된 뉴런이 원래 네트워크 매개변수와 어떻게 상호작용하는가?
  • RQ3이 제거 접근의 한계나 실패 모드는 무엇이며, 특히 gradient 기반 최적화에 대해 어떠한가?
  • RQ4새로운 PGB 프레임워크가 로컬 미니멈 제거를 넘어서 목적함수의 더 넓은 변환을 어떻게 조명하는가?

주요 결과

  • 출력 단위당 하나의 뉴런을 추가하면 수정된 목적함수의 모든 로컬 미니멈이 원래 목적함수의 전역 최솟값에 대응한다.
  • 모든 로컬 미니멈에서 수정된 네트워크는 원래 네트워크로 축소되며 추가된 구성요소는 사라진다.
  • 완만한 가정 하에 일반적인 손실 함수를 사용한 다중 클래스 분류, 이진 분류, 회귀에 대해 결과가 성립한다.
  • 새로운 PGB 필요조건은 로컬 미니멈을 분석하는 일반 도구를 제공하며 이 특정 문제를 넘어 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.