Skip to main content
QUICK REVIEW

[논문 리뷰] How do infinite width bounded norm networks look in function space?

Pedro Savarese, Itay Evron|arXiv (Cornell University)|2019. 02. 13.
Stochastic Gradient Optimization Techniques참고 문헌 22인용 수 15
한 줄 요약

이 논문은 유한한 무게 노름을 가진 무한 너비 ReLU 네트워크가 유도하는 함수 공간을 특성화하며, 단변수 함수를 표현하기 위한 최소 노름이 절대 이阶도 도함수의 적분과 첫 번째 도함수의 총 변동성에 의해 결정됨을 보여준다. 최적의 근사치는 선형 스퍼링 보간과 일치하며, 신경망 정규화와 함수 공간 내 자연스러운 인덕티브 바이어스를 연결한다.

ABSTRACT

We consider the question of what functions can be captured by ReLU networks with an unbounded number of units (infinite width), but where the overall network Euclidean norm (sum of squares of all weights in the system, except for an unregularized bias term for each unit) is bounded; or equivalently what is the minimal norm required to approximate a given function. For functions $f : \mathbb R ightarrow \mathbb R$ and a single hidden layer, we show that the minimal network norm for representing $f$ is $\max(\int |f''(x)| dx, |f'(-\infty) + f'(+\infty)|)$, and hence the minimal norm fit for a sample is given by a linear spline interpolation.

연구 동기 및 목표

  • 무한 너비 ReLU 네트워크에서 무게 노름 정규화가 유도하는 인덕티브 바이어스를 이해하기 위해.
  • 이러한 설정에서 주어진 단변수 함수를 표현하기 위해 필요한 최소 네트워크 노름을 특성화하기 위해.
  • 노름 최소화를 통해 신경망 학습과 선형 스퍼링 보간 간의 연결 고리를 설정하기 위해.
  • 단층 네트워크의 통찰을 다변수 및 더 깊은 아키텍처로 확장하기 위해.
  • 그린 함수와 이阶도 미분 연산자를 사용하여 네트워크 훈련을 변분 문제로 프레임하기 위해.

제안 방법

  • 저자들은 두 층으로 구성된 무한 너비의 ReLU 네트워크를 단위 구면 위의 서명 측도 α로 나타내는 측도 모델로 다룬다.
  • 함수 공간 노름을 측도 α의 L1 노름으로 유도하며, 이는 함수의 이阶도 도함수의 총 변동성과 해당한다.
  • 이阶도 도함수 연산자의 그린 함수를 사용하여, 네트워크 노름을 최소화하는 것이 특정 커널을 가진 변분 문제를 해결하는 것과 동치임을 보였다.
  • 최적의 함수 클래스는 이阶도 도함수의 총 변동성과 무한대에서 첫 번째 도함수의 절대합의 합을 최소화하는 선형 스퍼링임을 입증하였다.
  • 헤시안의 노름을 통한 일반화를 통해 다변수 함수로 분석을 확장하였다.
  • 이 프레임워크를 적용하여, 무한 너비 네트워크에서 깊이가 ℓ2/L 브릿지 페널티를 유도함을 보였다. 이는 선형 네트워크와 유사하다.

실험 결과

연구 질문

  • RQ1유한한 무게 노름을 가진 무한 너비 ReLU 네트워크에서 어떤 함수 클래스가 임의로 작은 노름으로 표현될 수 있는가?
  • RQ2최소 네트워크 노름이 목표 함수의 부드러움과 경계 행동과 어떻게 관련되어 있는가?
  • RQ3이러한 네트워크에서 최적의 보간이 선형 스퍼링 보간으로 특성화될 수 있는가?
  • RQ4노름 정규화 하에서 무한 너비 ReLU 네트워크에서 깊이가 인덕티브 바이어스에 어떻게 영향을 미치는가?
  • RQ5무한 너비 근사에서 측도 α의 L1 노름에 대응하는 함수 공간 노름이 존재하는가?

주요 결과

  • 단변수 함수 f를 표현하기 위한 최소 네트워크 노름은 max(∫|f''(x)|dx, |f'(-∞) + f'(∞)|)로 주어지며, 이는 함수의 곡률과 무한대에서의 도함수 변동성을 정량화한다.
  • 노름 최소화 하에서 유한한 데이터를 피팅하기 위한 최적의 해는 선형 스퍼링 보간이며, 최근의 보간 학습 연구에서 관찰된 인덕티브 바이어스와 일치한다.
  • 무한 너비의 유한한 노름을 가진 ReLU 네트워크가 유도하는 함수 공간은 이阶도 도함수의 총 변동성이 유한하고, 무한대에서 첫 번째 도함수의 변동성이 유계인 함수의 집합과 동일하다.
  • 그린 함수와의 연결을 통해, 노름 제약 조건 하에서 무한 너비 네트워크를 훈련하는 것은 이阶도 미분 연산자를 가진 변분 문제를 해결하는 것과 동치임을 드러냈다.
  • 다변수 함수의 경우, 저자들은 최소 노름이 헤시안의 핵심 노름의 적분과 일치할 것이라 추측한다. 이는 단변수 결과를 일반화한 것이다.
  • 무한 너비 네트워크에서 깊이가 ℓ2/L 브릿지 페널티를 유도하며, 더 깊은 아키텍처가 선형 네트워크와 유사하게 함수 공간 표현에서 희박성(sparse)을 유도할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.