Skip to main content
QUICK REVIEW

[论文解读] Learning Recurrent Neural Net Models of Nonlinear Systems

Joshua Hanson, Maxim Raginsky|arXiv (Cornell University)|Nov 18, 2020
Neural Networks and Applications参考文献 4被引用 4
一句话总结

本文提出了一种用于具有双曲正切激活函数的连续时间循环神经网络(RNN)的新颖训练方法,以建模非线性输入/输出系统。通过将系统辨识问题重新表述为使用至阶 $k$ 导数的喷射匹配问题,该方法实现了高置信度泛化,其一致范数风险界与神经元数量、样本大小和导数阶数成比例,首次为该设置下的RNN提供了此类定量保证。

ABSTRACT

We consider the following learning problem: Given sample pairs of input and output signals generated by an unknown nonlinear system (which is not assumed to be causal or time-invariant), we wish to find a continuous-time recurrent neural net with hyperbolic tangent activation function that approximately reproduces the underlying i/o behavior with high confidence. Leveraging earlier work concerned with matching output derivatives up to a given finite order, we reformulate the learning problem in familiar system-theoretic language and derive quantitative guarantees on the sup-norm risk of the learned model in terms of the number of neurons, the sample size, the number of derivatives being matched, and the regularity properties of the inputs, the outputs, and the unknown i/o map.

研究动机与目标

  • 开发一种基于学习理论的框架,用于使用连续时间RNN识别非线性输入/输出映射。
  • 为所学习RNN模型的一致范数风险提供严格的定量界。
  • 使用输入和输出信号的 $k$-喷射重新表述学习问题,以系统理论语言表达。
  • 建立依赖于神经元数量、样本大小、导数阶数 $k$ 以及输入/输出正则性的泛化保证。
  • 通过利用初始条件下的显式喷射计算,实现在无需时间反向传播的情况下进行训练。

提出的方法

  • 在初始化时刻将系统辨识重新表述为匹配 $k$-喷射——即输入和输出信号在阶数 $k$ 以内的截断泰勒展开——的问题。
  • 将预测输出 $k$-喷射表示为RNN权重、初始状态和输入 $(k-1)$-喷射的显式函数,从而实现直接回归。
  • 使用基于预测输出 $k$-喷射与真实输出 $k$-喷射之间差异的损失函数,避免顺序前向传播。
  • 应用基于VC维的泛化界来控制风险,其复杂度取决于 $k$、网络大小 $n$ 和样本大小 $N$。
  • 推导出最终的风险界,其中包含喷射近似误差项、真实系统模连续性项以及泛化误差项。
  • 将时间区间 $[0,T]$ 离散化为 $k$ 个子区间,以界定了喷射近似中的插值误差。

实验结果

研究问题

  • RQ1RNN能否以高置信度的一致范数误差界来近似非线性输入/输出映射?
  • RQ2匹配导数的数量($k$)如何影响RNN在系统辨识中的泛化性能?
  • RQ3能否通过在初始化时直接处理喷射导数,避免时间反向传播进行训练?
  • RQ4泛化误差对神经元数量、样本大小以及输入和输出正则性的依赖关系如何?
  • RQ5输入、输出和系统映射的模连续性如何影响最终的风险界?

主要发现

  • 所学习RNN的泛化风险以高概率被界为 $\bar{\mathcal{L}}^{*} + c(M(M+\sqrt{n}T)+\gamma_{\mathsf{F}}(R))\sqrt{\frac{k(n^{6}+n^{3}\log_{2}k)\log N+\log(1/\delta)}{N}}$,其中 $\bar{\mathcal{L}}^{*}$ 为最小期望损失。
  • 风险界中包含一项 $\frac{2\sqrt{n}}{k}MTe^{MT}$,随 $k$ 增大而衰减,反映了更高阶导数带来的更优喷射近似。
  • 输出映射的模连续性 $\omega_{\mathcal{Y}}(T/k)$ 贡献了一项 $2\omega_{\mathcal{Y}}(T/k)$,当 $k \to \infty$ 时趋于零。
  • 该方法实现了无需时间反向传播的泛化,通过基于喷射的回归将RNN视为单层前馈网络。
  • 函数类的VC维被界为 $O(kn^6 + kn^3\log k)$,控制了泛化误差项。
  • 最终风险界综合了喷射截断的近似误差、泛化误差和系统正则性,提供了全面的一致范数保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。