Skip to main content
QUICK REVIEW

[论文解读] The Recurrent Neural Tangent Kernel

Sina Alemohammad, Zichao Wang|arXiv (Cornell University)|Jun 18, 2020
Neural Networks and Applications参考文献 39被引用 6
一句话总结

本文提出了循环神经网络核(RNTK),一种基于核的框架,用于表征过参数化循环神经网络(RNNs)在无限宽度极限下的训练动态与泛化性能。结果表明,RNTK在训练过程中保持恒定形式,通过合适的初始化可实现有效的长期依赖学习,并在56个真实世界的时间序列数据集上,于分类与回归任务中均优于标准NTK和有限RNN。

ABSTRACT

The study of deep neural networks (DNNs) in the infinite-width limit, via the so-called neural tangent kernel (NTK) approach, has provided new insights into the dynamics of learning, generalization, and the impact of initialization. One key DNN architecture remains to be kernelized, namely, the recurrent neural network (RNN). In this paper we introduce and study the Recurrent Neural Tangent Kernel (RNTK), which provides new insights into the behavior of overparametrized RNNs. A key property of the RNTK should greatly benefit practitioners is its ability to compare inputs of different length. To this end, we characterize how the RNTK weights different time steps to form its output under different initialization parameters and nonlinearity choices. A synthetic and 56 real-world data experiments demonstrate that the RNTK offers significant performance gains over other kernels, including standard NTKs, across a wide array of data sets.

研究动机与目标

  • 将神经正切核(NTK)框架扩展至循环神经网络(RNNs),此前RNN尚未被核化。
  • 利用一种新型分析核——RNTK,分析过参数化RNN在无限宽度极限下的行为。
  • 探究RNTK是否能有效捕捉序列数据中的长期依赖关系,尽管RNN存在已知的梯度消失问题。
  • 评估RNTK的泛化性能,并与经典核、NTK及有限RNN在多样化的时间序列数据集上进行比较。
  • 基于RNTK对时间权重的分析,为RNN的超参数选择提供实用指导。

提出的方法

  • 推导出具有任意深度和序列长度的RNN中,ReLU与误差函数(erf)非线性激活函数的RNTK解析形式。
  • 证明RNTK在梯度流训练过程中保持恒定,从而将RNN的训练动态简化为线性常微分方程(ODE)系统。
  • 建立在无限宽度极限下,共享权重与非共享权重RNN均收敛至相同的RNTK,保持核等价性。
  • 分析不同初始化参数与非线性函数如何在RNTK中加权时间相关性,揭示长期依赖提取的机制。
  • 在核分类与回归中应用RNTK,使用基于RNTK特征的SVM进行性能基准测试,对比经典核与有限DNN。
  • 利用合成数据与真实世界时间序列数据(共56个数据集)验证RNTK在不同序列长度与任务下的性能。

实验结果

研究问题

  • RQ1尽管标准RNN存在梯度消失问题,RNTK是否能有效提取两段输入序列之间的长期依赖关系?
  • RQ2在RNN中使用共享循环权重是否会导致相比非共享权重的RNTK表示能力下降?
  • RQ3与经典核、NTK及有限RNN相比,RNTK在时间序列分类与回归任务中的泛化性能如何?
  • RQ4不同初始化参数与非线性函数如何影响RNTK中输入特征的时间加权方式?
  • RQ5RNTK能否作为时间序列学习的实际核函数,特别是在输入序列长度差异显著的情况下?

主要发现

  • RNTK在训练过程中保持恒定,使得过参数化RNN的梯度流动态可被描述为线性ODE系统。
  • 在合适的超参数初始化下,RNTK能成功捕捉序列数据中的长期依赖关系,克服梯度消失的限制。
  • 在无限宽度极限下,共享权重与非共享权重RNN均收敛至相同的RNTK,表明权重共享不会导致表示能力损失。
  • 在56个真实世界时间序列数据集上,RNTK在分类与回归任务中均优于经典核、标准NTK及有限RNN。
  • 当输入序列长度差异增大时,RNTK的性能增益也随之提升,表明其对可变长度输入具有强鲁棒性。
  • RNTK为超参数选择提供了实用洞见,表明特定的初始化选择可控制学习函数中时间步的加权方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。