[论文解读] Structured Neural Network Dynamics for Model-based Control
本文提出一种结构化神经网络架构,显式将系统动态建模为时变线性系统,通过直接输出时变雅可比矩阵(A 和 B 矩阵)实现与基于梯度的模型预测控制(MPC)的高效集成,避免了昂贵的在线导数计算。该方法通过学习全局动态模型,支持快速、可微分的线性化,从而实现最优控制合成,在连续控制环境中实现了有效控制。
We present a structured neural network architecture that is inspired by linear time-varying dynamical systems. The network is designed to mimic the properties of linear dynamical systems which makes analysis and control simple. The architecture facilitates the integration of learned system models with gradient-based model predictive control algorithms, and removes the requirement of computing potentially costly derivatives online. We demonstrate the efficacy of this modeling technique in computing autonomous control policies through evaluation in a variety of standard continuous control domains.
研究动机与目标
- 为解决将黑箱神经网络动态模型与基于梯度的最优控制算法集成的挑战,后者通常需要计算成本高昂的在线导数计算。
- 开发一种神经网络架构,强制在状态空间和控制空间中保持线性结构,从而简化时变雅可比矩阵(A 和 B)的恢复,以用于模型预测控制。
- 通过结合深度网络的表达能力与时变线性系统的解析可处理性,实现数据高效、可扩展的基于模型控制。
- 证明结构化动态模型可在无需依赖基于采样的优化的情况下,在多种连续控制任务中生成成功的自主控制策略。
提出的方法
- 该架构由两个并行子网络组成:A-子网络输出映射状态空间的矩阵,B-子网络输出映射控制空间的矩阵,两者分别被约束为与状态向量和控制向量的维度相匹配。
- 网络将系统动态计算为 $ \dot{x} = A(x,u) \cdot x + B(x,u) \cdot u $,其中 $ A $ 和 $ B $ 是通过反向传播学习到的非线性函数。
- 通过在状态-控制-导数三元组数据集上最小化预测与真实状态导数之间的均方误差,对 A-子网络和 B-子网络进行训练,以逼近真实系统动态。
- 所学习的 $ A $ 和 $ B $ 子网络可直接提供基于梯度的 MPC 所需的时变雅可比矩阵,从而在推理阶段无需进行数值或自动微分。
- 该方法被集成到一个模型预测控制框架中,该框架通过在有限时域内最小化代价函数来求解最优控制问题,利用预测动态和雅可比矩阵实现高效的轨迹优化。
- 模型使用 Adam 优化器进行训练,学习率为 0.001,且无需数据预处理。
实验结果
研究问题
- RQ1能否设计一种神经网络架构,显式编码用于基于梯度最优控制的时变系统雅可比矩阵(A 和 B 矩阵)?
- RQ2学习一种模仿时变线性系统的结构化动态模型,是否能提升在连续控制任务中基于模型控制的效率与准确性?
- RQ3与有限差分或自动微分等替代方法相比,该方法在计算成本和数值稳定性方面表现如何?
- RQ4该结构化神经网络能否学习全局动态模型,从而支持从不同初始条件和任意目标状态出发的成功控制?
主要发现
- 所提出的结构化神经网络在多个标准连续控制环境中(包括双连杆机械臂)成功生成了自主控制策略,其轨迹可从各种初始条件到达任意目标状态。
- 通过直接输出时变雅可比矩阵(A 和 B),该方法实现了与基于梯度的 MPC 的高效集成,无需额外导数计算,显著降低了在线计算成本。
- 该模型在不依赖基于采样的优化的情况下实现了有效控制,证明了在实时控制回路中使用学习到的、可微分动态模型的可行性。
- 实证结果表明,A 和 B 子网络的输出与真实梯度的方向一致,这在 MPC 中成功生成策略时得到了验证。
- 该方法对不同初始条件具有鲁棒性,并在双连杆机械臂环境中泛化至新的目标状态,表明所学习动态模型具有强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。