Skip to main content
QUICK REVIEW

[论文解读] Contracting Implicit Recurrent Neural Networks: Stable Models with Improved Trainability

Max Revay, Ian R. Manchester|arXiv (Cornell University)|Dec 22, 2019
Model Reduction and Neural Networks被引用 7
一句话总结

本文提出了一种新型RNN架构——隐式收缩循环神经网络(ci-RNNs),通过基于凸收缩的约束确保模型稳定性,从而实现更快的训练速度和更好的泛化性能。通过结合收缩分析与结构化初始化方案,ci-RNNs在性能上优于普通RNN和稳定RNN(s-RNNs),展现出更快的收敛速度和更少的不稳定训练轨迹,尤其在长序列任务(如人体步态预测)中表现突出。

ABSTRACT

Stability of recurrent models is closely linked with trainability, generalizability and in some applications, safety. Methods that train stable recurrent neural networks, however, do so at a significant cost to expressibility. We propose an implicit model structure that allows for a convex parametrization of stable models using contraction analysis of non-linear systems. Using these stability conditions we propose a new approach to model initialization and then provide a number of empirical results comparing the performance of our proposed model set to previous stable RNNs and vanilla RNNs. By carefully controlling stability in the model, we observe a significant increase in the speed of training and model performance.

研究动机与目标

  • 为解决循环神经网络(RNNs)在安全关键应用中普遍存在的不稳定性和训练困难问题。
  • 基于收缩分析,提出稳定RNN的凸参数化方法,避免使用非凸约束(如谱范数投影)的需要。
  • 通过设计一种能保持表达能力的同时强制稳定性的初始化方案,提升训练速度与模型性能。
  • 通过系统辨识与步态预测的实证基准,证明稳定RNN可实现更高效的训练,且不损失泛化能力。
  • 表明基于收缩的稳定性约束不会阻碍训练,而谱范数约束则会严重减缓收敛速度。

提出的方法

  • 提出一种隐式RNN结构,其中隐藏状态动态由固定点方程定义:$ x = \text{ReLU}(E x + W u) $,其中 $ E $ 和 $ W $ 为可学习矩阵。
  • 利用收缩理论施加凸稳定性条件:$ \Sigma \succ 0 $,其中 $ \Sigma = \text{diag}(\sigma_i) $,确保邻近轨迹的指数收敛。
  • 通过条件 $ \Sigma \succ 0 $ 推导出稳定性约束的凸参数化形式,实现高效优化与稳定训练。
  • 提出一种新颖的初始化方案,将 $ E $ 设为满足收缩条件的稳定矩阵,同时对 $ W $ 进行随机初始化并适当缩放。
  • 采用冗余参数化方式,在保持稳定性的同时提升动态表达能力,避免对谱范数投影的依赖。
  • 使用收缩度量确保增量稳定性,独立于平衡点或输入,保证有界输入-有界输出特性,并对输入扰动具有鲁棒性。

实验结果

研究问题

  • RQ1能否基于收缩分析推导出稳定RNN的凸参数化形式,以提升可训练性与泛化能力?
  • RQ2通过凸约束强制实现收缩稳定性,是否能相比无约束或谱范数约束的RNN实现更快的训练速度?
  • RQ3所提出的初始化方案是否能显著缩短训练时间,同时在序列任务中保持或提升模型性能?
  • RQ4在步态预测任务中,ci-RNNs在多个受试者上的测试误差与稳定性表现,相较于普通RNN和s-RNNs有何差异?
  • RQ5收缩约束是否会阻碍训练速度,还是相比谱范数约束能实现更快的收敛?

主要发现

  • ci-RNNs在模拟数据上的训练误差曲线显示,其训练收敛速度显著快于普通RNN和s-RNNs。
  • 与隐式模型的标准初始化相比,所提出的初始化方案将训练时间减少了50%以上,且未造成稳定性或性能损失。
  • 在步态预测任务中,ci-RNNs在所有受试者和模型深度下均优于RNNs和s-RNNs,测试集上的归一化模拟误差(NSE)更低。
  • 所有训练出的ci-RNNs均优于其对应的s-RNN,其中100%的3层模型表现出更低的测试NSE,且未观察到不稳定模型。
  • 与谱范数约束(如引入投影的RNN)严重减缓训练不同,收缩约束并未阻碍优化,反而实现了更快的收敛。
  • 具有收缩约束的隐式模型结构泛化能力更强,表现为更低的测试NSE,且在步态预测任务中未出现无界误差轨迹。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。