Skip to main content
QUICK REVIEW

[論文レビュー] Learning Recurrent Neural Net Models of Nonlinear Systems

Joshua Hanson, Maxim Raginsky|arXiv (Cornell University)|Nov 18, 2020
Neural Networks and Applications参考文献 4被引用数 4
ひとこと要約

本稿は、非線形入出力システムをモデル化するための双曲正接活性化関数を備えた連続時間再帰的ニューラルネットワーク(RNN)の新しい学習手法を提案する。高次導関数までを用いた$ k $次までの微分を用いてシステム同定をジャットマッチング問題に再定式化することで、ニューロン数、サンプルサイズ、および導関数の次数に依存する、スノルムリスクバウンドを伴う高信頼性の一般化が可能となり、本設定におけるRNNに対する初めての定量的保証を提供する。

ABSTRACT

We consider the following learning problem: Given sample pairs of input and output signals generated by an unknown nonlinear system (which is not assumed to be causal or time-invariant), we wish to find a continuous-time recurrent neural net with hyperbolic tangent activation function that approximately reproduces the underlying i/o behavior with high confidence. Leveraging earlier work concerned with matching output derivatives up to a given finite order, we reformulate the learning problem in familiar system-theoretic language and derive quantitative guarantees on the sup-norm risk of the learned model in terms of the number of neurons, the sample size, the number of derivatives being matched, and the regularity properties of the inputs, the outputs, and the unknown i/o map.

研究の動機と目的

  • 連続時間RNNを用いた非線形入出力マップの同定のための学習理論的枠組みを構築すること。
  • 学習されたRNNモデルのスノルムリスクに対する厳密な定量的バウンドを提供すること。
  • 入力および出力信号の$ k $次ジャットを用いたシステム理論的言語による学習問題の再定式化。
  • ニューロン数、サンプルサイズ、導関数の次数$ k $、および入出力の正則性に依存する一般化保証の確立。
  • 初期状態からの明示的ジャット計算を活用することで、バックプロパゲーション・スル・タイムを回避する訓練プロセスの実現。

提案手法

  • 初期状態で、入力および出力信号の$ k $次ジャット($ k $次までのテイラー展開の切り捨て)のマッチング問題にシステム同定を再定式化する。
  • 予測出力$ k $次ジャットをRNN重み、初期状態、および入力$ (k-1) $次ジャットの明示的関数として表現し、直接回帰が可能となる。
  • 予測された出力$ k $次ジャットと真値との差に基づく損失関数を用い、逐次的前向き伝搬を回避する。
  • VC次元に基づく一般化バウンドを適用してリスクを制御し、複雑さは$ k $、ネットワークサイズ$ n $、およびサンプルサイズ$ N $に依存する。
  • ジャット近似誤差、真のシステムのモジュラス連続性、および一般化誤差を含む最終的なリスクバウンドを導出する。
  • 時間区間$[0,T]$を$ k $個の部分に離散化することで、ジャット近似における補間誤差をバウンドする。

実験結果

リサーチクエスチョン

  • RQ1RNNは、高信頼性のスノルム誤差バウンドを伴って非線形入出力マップを近似可能か?
  • RQ2マッチングされる導関数の次数($ k $)が、システム同定におけるRNNの一般化性能にどのように影響するか?
  • RQ3初期状態でのジャット導関数を直接扱うことで、バックプロパゲーション・スル・タイムを回避できるか?
  • RQ4一般化誤差は、ニューロン数、サンプルサイズ、および入出力の正則性にどのように依存するか?
  • RQ5入力、出力、およびシステムマップのモジュラス連続性は、最終的なリスクバウンドにどのように影響するか?

主な発見

  • 学習されたRNNの一般化リスクは、高確率で$\bar{\mathcal{L}}^{*} + c(M(M+\sqrt{n}T)+\gamma_{\mathsf{F}}(R))\sqrt{\frac{k(n^{6}+n^{3}\log_{2}k)\log N+\log(1/\delta)}{N}}$によりバウンドされ、ここで$\bar{\mathcal{L}}^{*}$は最小期待損失である。
  • リスクバウンドには$\frac{2\sqrt{n}}{k}MTe^{MT}$という項が含まれ、$ k $が増加するにつれて減少し、高次導関数によるジャット近似の向上を反映している。
  • 出力マップのモジュラス連続性$\omega_{\mathcal{Y}}(T/k)$が、$2\omega_{\mathcal{Y}}(T/k)$という項として寄与し、$ k \to \infty $のとき消える。
  • バックプロパゲーション・スル・タイムを回避する一般化が達成され、ジャットベースの回帰によりRNNを1層のフィードフォワードネットとして扱う。
  • 関数クラスのVC次元は$ O(kn^6 + kn^3\log k) $でバウンドされ、これが一般化誤差項を制御する。
  • 最終的なリスクバウンドは、ジャット切断による近似誤差、一般化誤差、およびシステムの正則性を組み合わせており、包括的なスノルム保証を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。