Skip to main content
QUICK REVIEW

[논문 리뷰] Over-parametrized deep neural networks do not generalize well

Michael Köhler, Adam Krzyżak|arXiv (Cornell University)|2019. 12. 09.
Sparse and Compressive Sensing Techniques참고 문헌 21인용 수 9
한 줄 요약

이 논문은 시그모이드 활성화 함수를 가진 과다 매개변수화된 딥 네ural 네트워크가 비모수적 회귀에서 조건이 충족되더라도 일반화 성능이 좋지 않음을 입증한다. 심지어 학습 오차가 0이 되더라도 그렇다. 이 논문은 매끄러운 회귀 함수에 대해 최적의 최소최대 수렴 속도를 달성하지 못함을 보여주는 하한선을 제시하며, 과다 매개변수화가 좋은 일반화를 보장한다는 가정에 도전한다.

ABSTRACT

Recently it was shown in several papers that backpropagation is able to find the global minimum of the empirical risk on the training data using over-parametrized deep neural networks. In this paper a similar result is shown for deep neural networks with the sigmoidal squasher activation function in a regression setting, and a lower bound is presented which proves that these networks do not generalize well on a new data in the sense that they do not achieve the optimal minimax rate of convergence for estimation of smooth regression functions.

연구 동기 및 목표

  • 과다 매개변수화된 딥 네럴 네트워크에 시그모이드 활성화 함수를 적용할 경우 비모수적 회귀에서 최적의 일반화 성능를 달성할 수 있는지 조사하기 위해.
  • 과다 매개변수화된 상황에서 최소 제곱법 기반 네럴 네트워크 추정치의 일반화 오차를 분석하기 위해.
  • 과다 매개변수화된 네럴 네트워크의 수렴 속도에 대한 이론적 하한선을 설정하여, 이들이 최소최대 최적 수렴 속도를 달성하지 못함을 보여주기 위해.
  • 학습 오차를 최소화할 수 있는 상황에서 과다 매개변수화가 좋은 일반화를 보장한다는 일반적인 가정에 도전하기 위해.

제안 방법

  • 랜덤 디자인을 가진 회귀 프레임워크를 사용하며, 회귀 함수는 매끄럽고 오차는 유한함을 가정한다.
  • L개의 은닉층과 시그모이드 스쿼셔 활성화 함수를 가진 네럴 네트워크 아키텍처를 정의하고, 최소 제곱 최소화를 통해 가중치를 학습시킨다.
  • n개의 서로 다른 입력 포인트를 가진 특정한 데이터 분포를 구성하며, 각 입력 포인트는 동일한 확률 1/n을 가진다. 또한 i.i.d. 대칭 노이즈(±1)를 가진다.
  • 관측된 입력 포인트에서의 경험적 평균을 사용하는 네AREST-neighbor 유사 추정치 $\bar{m}_n$을 기준선으로 정의한다.
  • 네럴 네트워크 추정치를 $\bar{m}_n$과 연결하고 농도 불등식을 사용하여 기대 $L_2$ 리스크에 대한 하한선을 유도한다.
  • 각 입력 포인트가 관측되는 횟수의 분포가 이항분포임을 활용하며, 역점유 계수의 기대값을 사용하여 하한선을 유도한다.

실험 결과

연구 질문

  • RQ1과다 매개변수화된 딥 네럴 네트워크에 시그모이드 활성화 함수를 적용할 경우 비모수적 회귀에서 최적의 최소최대 수렴 속도를 달성할 수 있는가?
  • RQ2백프로파게이션 알고리즘이 학습 오차를 최소화할 수 있다는 사실이 이러한 네트워크의 좋은 일반화 성능를 보장하는가?
  • RQ3과다 매개변수화된 상황에서 최소 제곱 네럴 네트워크 추정치의 일반화 오차에 대한 본질적인 하한선은 무엇인가?
  • RQ4기대 $L_2$ 리스크 측면에서 네럴 네트워크 추정치는 단순 경험 평균 추정치보다 어떻게 비교되는가?
  • RQ5학습 데이터를 완벽하게 피팅할 수 있는 과다 매개변수화된 네트워크의 일반화 성능에 이론적인 한계가 존재하는가?

주요 결과

  • 과다 매개변수화된 딥 네럴 네트워크에 시그모이드 활성화 함수를 적용할 경우, 매끄러운 회귀 함수에 대해 최적의 최소최대 수렴 속도를 달성하지 못함을 보여주며 일반화 성능이 좋지 않다.
  • 네럴 네트워크 추정치의 기대 $L_2$ 리스크는 n이 증가하더라도 사라지지 않는 양수 상한선으로 유계임을 보여주며, 이는 열악한 일반화 성능를 의미한다.
  • 하한선은 네럴 네트워크 추정치를 기준선 경험 평균 추정치 $\bar{m}_n$과 비교하여 유도되었으며, 네트워크의 오차가 상당히 작아지지 않음을 보여준다.
  • 분석 결과, 네트워크가 학습 데이터를 완벽하게 피팅하더라도(학습 오차가 0이더라도), 입력 분포의 구조와 노이즈의 영향으로 인해 일반화 오차는 여전히 0에서 멀리 떨어져 있음을 드러낸다.
  • 하한선은 $n \geq 10$ 인 경우 최소 $\frac{10}{11} \left(1 - \frac{21}{10e}\right)$로 정량적으로 유도되었으며, 이 값은 0에서 멀리 떨어져 있어 최적성에 미달됨을 증명한다.
  • 네트워크가 과다 매개변수화되어 있고 학습 데이터를 완전히 보간할 수 있음에도 불구하고 이 결과는 성립하며, 이는 보간이 좋은 일반화를 의미하지는 않음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.