Skip to main content
QUICK REVIEW

[논문 리뷰] Function approximation by deep networks

H. N. Mhaskar, Tomaso Poggio|arXiv (Cornell University)|2019. 05. 30.
Neural Networks and Applications참고 문헌 21인용 수 4
한 줄 요약

이 논문은 깊이 있는 신경망이 구성 함수(더 간단한 함수들의 방향성 비순환 그래프로 표현 가능한 함수)를 근사할 때, 목표 함수의 계층적 구조와의 구조적 유사성을 활용함으로써 얕은 네트워크보다 우수한 성능을 보임을 보여준다. 핵심 기여는 리프시츠 연속성 하에서 얕은 네트워크의 근사 정리들을 깊이 있는 네트워크로 이행할 수 있게 해주는 '오류의 좋은 전파' 이론적 프레임워크이다. 이는 동시에 전통적인 머신러닝 일반화 이론이 구성성에 대한 자연스러운 측도가 부족하여 붕괴됨을 보여준다.

ABSTRACT

We show that deep networks are better than shallow networks at approximating functions that can be expressed as a composition of functions described by a directed acyclic graph, because the deep networks can be designed to have the same compositional structure, while a shallow network cannot exploit this knowledge. Thus, the blessing of compositionality mitigates the curse of dimensionality. On the other hand, a theorem called good propagation of errors allows to `lift' theorems about shallow networks to those about deep networks with an appropriate choice of norms, smoothness, etc. We illustrate this in three contexts where each channel in the deep network calculates a spherical polynomial, a non-smooth ReLU network, or another zonal function network related closely with the ReLU network.

연구 동기 및 목표

  • 깊이 있는 네트워크가 얕은 네트워크보다 우수한 근사 능력을 지닌 이유에 대한 이론적 기반을 확립하는 것.
  • 목표 함수의 구성성 구조의 역할을 체계화하고, 깊이 있는 네트워크가 이를 어떻게 활용할 수 있는지 명시하는 것.
  • 얕은 네트워크의 근사 결과를 깊이 있는 네트워크로 이행할 수 있도록 '오류의 좋은 전파' 정리를 개발하고 적용하는 것.
  • 구성 함수의 맥락에서 전통적인 머신러닝 일반화 이론의 한계를 조사하는 것.
  • 딥 ReLU 및 관련 네트워크에서 근사 속도와 목표 함수의 스무쓰니스의 관계를 연결하는 역정리들을 제공하는 것.

제안 방법

  • 구성 함수의 구조를 구성 요소 함수들의 방향성 비순환 그래프(DAG)로 모델링한다.
  • 리프시츠 연속성 하에서 얕은 네트워크에서 깊이 있는 네트워크로 근사 경계를 전이할 수 있도록 '오류의 좋은 전파' 정리를 도입한다.
  • 이론을 구체적으로 설명하기 위해 구면 다항식, ReLU 네트워크, 조절 함수 네트워크를 사례로 사용한다.
  • 특히 구면 C(S^q) 위에서의 균일 노름을 포함한 바나흐 공간 노름을 기반으로 근사 오차를 정의한다.
  • 너비 정리와 역정리를 적용하여 근사 속도의 상한과 하한을 설정한다.
  • 비선형 너비와 스무쓰니스 클래스 W^γ를 사용하여 근사 오차 감소를 특성화한다.

실험 결과

연구 질문

  • RQ1왜 일부 함수 클래스에 대해서는 깊이 있는 네트워크가 얕은 네트워크보다 더 뛰어난 근사 속도를 달성하는가?
  • RQ2얕은 네트워크 근사에 관한 정리들을 깊이 있는 네트워크로 체계적으로 확장할 수 있는가?
  • RQ3목표 함수의 구성성 구조가 근사 오차 감소에 어떤 역할을 하는가?
  • RQ4왜 구성 함수의 맥락에서 전통적인 편향-분산 분해가 실패하는가?
  • RQ5관측된 근사 속도를 통해 목표 함수의 스무쓰니스 클래스를 추론할 수 있는가?

주요 결과

  • 목표 함수가 DAG로 표현 가능한 구성 구조를 지닐 경우, 깊이 있는 네트워크는 얕은 네트워크보다 더 뛰어난 근사 속도를 달성한다.
  • 오류의 좋은 전파 정리는 구성 요소 함수들이 리프시츠 연속일 경우, 얕은 네트워크의 근사 정리를 깊이 있는 네트워크로 이행할 수 있도록 해준다.
  • ReLU 네트워크의 경우, 스무쓰니스 클래스 W^γ에 속하는 함수에 대해 근사 오차가 O(N^{-γ/q})로 감소하며, 이는 알려진 하한값과 일치한다.
  • 역정리들은 관측된 근사 속도가 목표 함수가 특정 스무쓰니스 클래스 W^γ에 속해야 한다는 것을 시사한다.
  • 표준 L2-노름 일반화 오차 프레임워크는 구성 함수의 맥락에서 자연스러운 확률 측도가 없기 때문에 실패한다.
  • 이 프레임워크에서 최적의 속도로 근사 가능한 함수의 클래스는 아마도 가능한 한 최고일 것이며, 상한값이 알려진 하한값과 일치하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.