Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Recurrent Neural Net Models of Nonlinear Systems

Joshua Hanson, Maxim Raginsky|arXiv (Cornell University)|2020. 11. 18.
Neural Networks and Applications참고 문헌 4인용 수 4
한 줄 요약

이 논문은 비선형 입력/출력 시스템을 모델링하기 위해 탄성하강 함수를 갖는 연속시간 순환 신경망(RNN)을 위한 새로운 학습 방법을 제안한다. 차수 $k$까지의 도함수를 사용하여 시스템 식별 문제를 제트 매칭 문제로 재구성함으로써, 뉴런 수, 표본 크기, 도함수 차수에 따라 스케일링되는 $L^\infty$ 노름 위험 경계를 제공하는 고신뢰도 일반화가 가능해지며, 이는 이 설정에서 RNN에 대해 처음으로 이러한 정량적 보장을 제공한다.

ABSTRACT

We consider the following learning problem: Given sample pairs of input and output signals generated by an unknown nonlinear system (which is not assumed to be causal or time-invariant), we wish to find a continuous-time recurrent neural net with hyperbolic tangent activation function that approximately reproduces the underlying i/o behavior with high confidence. Leveraging earlier work concerned with matching output derivatives up to a given finite order, we reformulate the learning problem in familiar system-theoretic language and derive quantitative guarantees on the sup-norm risk of the learned model in terms of the number of neurons, the sample size, the number of derivatives being matched, and the regularity properties of the inputs, the outputs, and the unknown i/o map.

연구 동기 및 목표

  • 연속시간 RNN을 사용하여 비선형 입력/출력 맵을 식별하기 위한 학습이론적 프레임워크를 개발한다.
  • 학습된 RNN 모델의 $L^\infty$ 노름 위험에 대한 엄밀한 정량적 경계를 제공한다.
  • 입력 및 출력 신호의 $k$-제트를 사용하여 학습 문제를 시스템 이론어휘로 재구성한다.
  • 뉴런 수, 표본 크기, 도함수 차수 $k$, 그리고 입력/출력의 정규성에 따라 의존하는 일반화 보장을 수립한다.
  • 초기 조건에서의 명시적 제트 계산을 활용하여 시간에 따른 역전파 없이도 학습을 가능하게 한다.

제안 방법

  • 초기 조건에서 입력 및 출력 신호의 $k$-제트—차수 $k$까지의 타일러 전개의 절단된 형태—를 매칭하는 문제로 시스템 식별을 재구성한다.
  • 예측된 출력 $k$-제트를 RNN 가중치, 초기 상태, 입력 $(k-1)$-제트의 명시적 함수로 표현함으로써 직접 회귀를 가능하게 한다.
  • 예측된 출력 $k$-제트와 진짜 출력 $k$-제트의 차이를 기반으로 한 손실 함수를 사용하여 순차적 전방전파를 피한다.
  • VC 차원 기반 일반화 경계를 적용하여 위험을 제어하며, 복잡도는 $k$, 네트워크 크기 $n$, 표본 크기 $N$에 따라 달라진다.
  • 최종 위험 경계를 유도하며, 제트 근사 오차, 진짜 시스템의 연속성 모듈러스, 일반화 오차를 포함하는 항이 포함된다.
  • 시간 간격 $[0,T]$를 $k$개의 부분구간으로 이산화하여 제트 근사에서의 보간 오차를 제한한다.

실험 결과

연구 질문

  • RQ1RNN은 비선형 입력/출력 맵을 고신뢰도 $L^\infty$ 노름 오차 경계로 근사화할 수 있는가?
  • RQ2매칭된 도함수의 수($k$)가 시스템 식별에서 RNN의 일반화 성능에 어떻게 영향을 미치는가?
  • RQ3초기 조건에서의 제트 도함수를 직접 다룸으로써 시간에 따른 역전파 없이도 학습 과정을 수행할 수 있는가?
  • RQ4일반화 오차는 뉴런 수, 표본 크기, 그리고 입력 및 출력의 정규성에 따라 어떻게 의존하는가?
  • RQ5입력, 출력 및 시스템 맵의 연속성 모듈러스는 최종 위험 경계에 어떻게 영향을 미치는가?

주요 결과

  • 학습된 RNN의 일반화 위험은 $\bar{\mathcal{L}}^{*} + c(M(M+\sqrt{n}T)+\gamma_{\mathsf{F}}(R))\sqrt{\frac{k(n^{6}+n^{3}\log_{2}k)\log N+\log(1/\delta)}{N}}$로 고확률적으로 경계지며, 여기서 $\bar{\mathcal{L}}^{*}$는 최소 기대 손실이다.
  • 위험 경계에는 $k$가 증가함에 따라 감소하는 항 $\frac{2\sqrt{n}}{k}MTe^{MT}$가 포함되어 있으며, 이는 고차수 도함수에 의한 개선된 제트 근사 반영을 나타낸다.
  • 출력 맵의 연속성 모듈러스 $\omega_{\mathcal{Y}}(T/k)$는 항 $2\omega_{\mathcal{Y}}(T/k)$로 기여하며, $k \to \infty$일 때는 소멸한다.
  • 이 방법은 시간에 따른 역전파 없이도 일반화를 달성하며, 제트 기반 회귀를 통해 RNN을 단일층 전방향 신경망으로 간주한다.
  • 함수 클래스의 VC 차원은 $O(kn^6 + kn^3\log k)$로 경계지며, 이는 일반화 오차 항을 제어한다.
  • 최종 위험 경계는 제트 절단 오차, 일반화 오차, 시스템 정규성의 조합을 포함하여 종합적인 $L^\infty$ 노름 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.