Skip to main content
QUICK REVIEW

[논문 리뷰] Arbitrary-Depth Universal Approximation Theorems for Operator Neural Networks

Annan Yu, Chloé Becquey|arXiv (Cornell University)|2021. 09. 23.
Neural Networks and Applications참고 문헌 14인용 수 5
한 줄 요약

이 논문은 깊이가 나간, 좁은 너비의 연산자 신경망(Operator NNs)에 대한 최초의 보편적 근사 정리들을 수립한다. 비다항 또는 비첨가 다항 활성화 함수를 갖는 너비 5의 연산자 NN이 어떤 연속적인 비선형 연산자라도 보편적으로 근사할 수 있음을 증명한다. 이 방법은 입력을 잘라내고, 깊이에 따라 달라지는 디코더 네트워크를 사용하여 다수의 입력을 하나의 값으로 인코딩함으로써, 임의의 깊이에서 일정한 너비로 근사가 가능하도록 한다.

ABSTRACT

The standard Universal Approximation Theorem for operator neural networks (NNs) holds for arbitrary width and bounded depth. Here, we prove that operator NNs of bounded width and arbitrary depth are universal approximators for continuous nonlinear operators. In our main result, we prove that for non-polynomial activation functions that are continuously differentiable at a point with a nonzero derivative, one can construct an operator NN of width five, whose inputs are real numbers with finite decimal representations, that is arbitrarily close to any given continuous nonlinear operator. We derive an analogous result for non-affine polynomial activation functions. We also show that depth has theoretical advantages by constructing operator ReLU NNs of depth $2k^3+8$ and constant width that cannot be well-approximated by any operator ReLU NN of depth $k$, unless its width is exponential in $k$.

연구 동기 및 목표

  • 제한된 너비와 임의의 깊이를 갖는 연산자 신경망에 대한 보편적 근사 정리를 수립하여 기존 이론의 격차를 메운다.
  • 얕고 넓은 네트워크가 지수적 너비가 필요로 하는 반면, 깊고 좁은 연산자 NN이 보편적 근사를 달성할 수 있음을 보여준다.
  • 깊이의 이론적 이점이 무엇인지 밝혀내기 위해, 깊이가 적은 네트워크로는 잘 근사할 수 없고 지수적 너비 증가 없이도 근사가 가능한 연산자 NN을 구성한다.
  • 일般적으로 표준 UAT에서 제외되는 비첨가 다항 활성화 함수를 보편적 근사에 적용할 수 있음을 보여준다.
  • 입력 인코딩과 자르기 전략을 통해 최소 너비의 네트워크로 연속적인 비선형 연산자를 효과적으로 근사할 수 있는 견고한 프레임워크를 제공한다.

제안 방법

  • 목표 정밀도 ε에 기반해 실수 입력을 유한한 소수 표현으로 자르는 것으로, 이를 단일 스칼라 값으로 인코딩할 수 있도록 한다.
  • 깊이에 따라 달라지는 디코더 네트워크를 사용하여 인코딩된 스칼라에서 개별적으로 잘라낸 입력을 추출하며, 이는 임의로 깊은 ReLU 네트워크로 근사된다.
  • 한 개의 뉴런이 인코딩된 입력을 전파하고, 추가 뉴런들이 디코딩 및 계산을 담당하는 너비 5의 연산자 NN을 구성한다.
  • 표준 순환 신경망의 보편적 근사 정리를 인코딩된 함수 공간에 적용하여 컴acts 집합 위에서 균일한 근사를 보장한다.
  • 어느 점에서 연속적으로 미분 가능하고 도함수가 0이 아닌 활성화 함수의 조밀성 성질을 활용하여 근사 능력을 보장한다.
  • 비첨가 다항 활성화 함수로의 결과 확장을 위해, 두 번째 도함수 조건을 사용하여 최소 너비로 효과적인 디코딩을 가능하게 한다.

실험 결과

연구 질문

  • RQ1제한된 너비와 임의의 깊이를 갖는 연산자 신경망이 연속적인 비선형 연산자를 보편적으로 근사할 수 있는가?
  • RQ2다양한 활성화 함수의 광범위한 클래스에 대해 보편적 근사를 달성하기 위해 깊이가 나간 연산자 NN이 필요한 최소 너비는 얼마인가?
  • RQ3얕고 넓은 네트워크에 비해 깊이가 어떤 특정 연산자를 근사하는 데 이론적으로 어떤 이점을 제공하는가?
  • RQ4비첨가 다항 활성화 함수는 얕은 아키텍처에서의 제약에도 불구하고 연산자 네트워크의 보편적 근사에 사용될 수 있는가?
  • RQ5입력 인코딩과 자르기 전략이 연산자 신경망 설계에서 너비 요구 조건을 어느 정도 줄일 수 있는가?

주요 결과

  • 어느 점에서 연속적으로 미분 가능하고 도함수가 0이 아닌 비다항 활성화 함수를 갖는 너비 5의 연산자 신경망은 임의의 연속적인 비선형 연산자를 원하는 오차 ε 이내로 균일하게 근사할 수 있다.
  • 비첨가 다항 활성화 함수의 경우, 너비 6의 연산자 NN이 보편적 근사를 위해 충분하며, 두 번째 도함수 조건을 만족할 경우 너비 5의 구성도 가능하다.
  • 깊이 $2k^3 + 8$ 이고 일정 너비인 연산자 ReLU 네트워크는 깊이 $k$의 어떤 연산자 ReLU 네트워크로도 잘 근사될 수 없으며, 이는 너비가 $k$에 대해 지수적으로 증가하지 않는 한 성립하지 않는다. 이는 깊이의 이론적 이점이 있음을 보여준다.
  • 입력 인코딩 및 자르기 전략은 다수의 입력을 단일 스칼라로 줄여 일정 너비 근사를 가능하게 하며, 디코딩은 깊은 서브네트워크를 통해 수행된다.
  • 근사에 필요한 샘플링 포인트 수 $m$은 활성화 함수에 영향을 받지 않으며, 목표 정밀도와 연산자 연속성에만 의존한다.
  • 이 프레임워크는 기존의 보편적 근사 정리를 확장하여 너비와 깊이 사이의 트레이드오프를 이동시켰으며, 깊이만으로도 최소 너비로 보편적 근사를 가능하게 함을 증명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.