Skip to main content
QUICK REVIEW

[论文解读] Learning Stable Deep Dynamics Models for Partially Observed or Delayed Dynamical Systems

Andreas Schlaginhaufen, Philippe Wenk|arXiv (Cornell University)|Oct 27, 2021
Model Reduction and Neural Networks被引用 4
一句话总结

本文提出神经延迟微分方程(NDDEs),采用一种新颖的李雅普诺夫-拉祖米欣正则化方法,以学习稳定、部分可观测或具有延迟的动态系统。通过将状态与其历史记录相结合,并利用神经网络李雅普诺夫-拉祖米欣函数强制实现稳定性,该方法即使在稀疏、噪声观测和输入延迟条件下,也能确保系统指数收敛至平衡点,从而实现鲁棒的系统辨识与稳定反馈策略学习。

ABSTRACT

Learning how complex dynamical systems evolve over time is a key challenge in system identification. For safety critical systems, it is often crucial that the learned model is guaranteed to converge to some equilibrium point. To this end, neural ODEs regularized with neural Lyapunov functions are a promising approach when states are fully observed. For practical applications however, partial observations are the norm. As we will demonstrate, initialization of unobserved augmented states can become a key problem for neural ODEs. To alleviate this issue, we propose to augment the system's state with its history. Inspired by state augmentation in discrete-time systems, we thus obtain neural delay differential equations. Based on classical time delay stability analysis, we then show how to ensure stability of the learned models, and theoretically analyze our approach. Our experiments demonstrate its applicability to stable system identification of partially observed systems and learning a stabilizing feedback policy in delayed feedback control.

研究动机与目标

  • 解决标准神经ODE在应用于部分可观测或延迟动态系统时出现的不稳定性与泛化能力差的问题。
  • 克服在动态系统中为增强型神经ODE(ANODEs)初始化未观测到的扩展状态这一关键挑战。
  • 将神经李雅普诺夫函数正则化方法从ODE推广至时滞系统,采用李雅普诺夫-拉祖米欣方法。
  • 实现在具有输入延迟的系统中稳定系统辨识与稳定反馈策略的学习。
  • 为NDDEs提供理论稳定性保证与实用化实现,采用一种新颖的正则化方案。

提出的方法

  • 通过引入过去历史记录来扩展系统状态,以建模非马氏动态,将标准神经ODE转化为神经延迟微分方程(NDDEs)。
  • 引入基于神经网络的李雅普诺夫-拉祖米欣函数,以强制实现NDDE模型的指数稳定性。
  • 基于李雅普诺夫-拉祖米欣定理设计正则化损失,确保在时滞不变域内,李雅普诺夫函数沿轨迹的导数为负定。
  • 采用离散化数值格式处理时滞系统的无限维状态空间,从而实现通过反向传播进行训练。
  • 使用联合损失函数训练NDDE:包括数据重构损失与所提出的李雅普诺夫-拉祖米欣正则化损失。
  • 将该框架应用于学习延迟控制系统的稳定反馈策略,以初始LQR增益作为热启动。

实验结果

研究问题

  • RQ1在标准神经ODE失效的部分可观测或延迟动态系统中,基于历史记录扩展状态的NDDE是否能有效建模?
  • RQ2所提出的李雅普诺夫-拉祖米欣正则化是否能确保在未见轨迹上,所学习的NDDE模型具有指数稳定性?
  • RQ3在部分观测与噪声条件下,NDDE方法与ANODEs在稳定性与泛化能力方面相比如何?
  • RQ4该框架是否能成功学习延迟控制系统的稳定反馈策略,即使初始策略不稳定?
  • RQ5超参数α与q对所学习动态系统收敛速度与稳定性的影响如何?

主要发现

  • 采用历史记录扩展的NDDE模型在部分可观测系统中,其稳定性和泛化能力优于标准ANODEs,避免了对未观测初始状态的估计需求。
  • 所提出的李雅普诺夫-拉祖米欣正则化确保了所学习动态系统的指数稳定性,且在新测试轨迹上LRF损失为零,表明稳定性验证有效。
  • 在延迟倒立摆实验中,所学习的反馈策略成功稳定了系统,且可通过超参数α与q控制衰减率。
  • 在具有0.05秒输入延迟的CartPole实验中,该方法成功学习到稳定反馈策略,而初始LQR控制器则不稳定。
  • 该方法在多个测试轨迹上实现了稳定的系统辨识,中位数测试损失位于0.05–0.95分位数范围内,表明对噪声与初始化具有鲁棒性。
  • 代码与理论分析已公开,支持可复现性,并可推广至其他延迟或部分可观测动态系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。