Skip to main content
QUICK REVIEW

[论文解读] Algorithms of Data Development For Deep Learning and Feedback Design

Wei Kang, Qi Gong|arXiv (Cornell University)|Dec 1, 2019
Model Reduction and Neural Networks参考文献 31被引用 14
一句话总结

本文提出了一种无因果关系的算法,用于生成高维数据以训练深度神经网络,实现最优反馈控制,支持高效、无网格且可并行化的训练。通过在每个点独立计算价值函数解,该方法支持自适应数据生成与经验误差验证,已在6维刚体控制问题中得到验证,使用4,096个数据点,经过四轮训练后神经网络精度得到提升。

ABSTRACT

Recent research reveals that deep learning is an effective way of solving high dimensional Hamilton-Jacobi-Bellman equations. The resulting feedback control law in the form of a neural network is computationally efficient for real-time applications of optimal control. A critical part of this design method is to generate data for training the neural network and validating its accuracy. In this paper, we provide a survey of existing algorithms that can be used to generate data. All the algorithms surveyed in this paper are causality-free, i.e., the solution at a point is computed without using the value of the function at any other points. At the end of the paper, an illustrative example of optimal feedback design using deep learning is given.

研究动机与目标

  • 解决高维系统中求解哈密顿-雅可比-贝尔曼(HJB)方程时的维数灾难问题。
  • 开发无因果关系的算法,独立在每个点计算价值函数解,避免依赖网格,支持并行化。
  • 通过在价值函数复杂或陡峭区域实现有针对性的高精度数据采集,支持深度学习的自适应数据生成。
  • 提供一种可靠且经经验验证的方法,用于训练神经网络作为反馈控制器,通过独立数据集进行验证。
  • 展示基于无因果关系数据生成的深度学习反馈控制在高维最优控制问题中的可行性与可扩展性。

提出的方法

  • 使用无因果关系的数值求解器在不依赖邻近值的情况下独立计算每个点的价值函数 $ V(t, \mathbf{x}) $,避免使用网格方法。
  • 生成初始数据集 $ N_d $ 个随机初始状态 $ \mathbf{x}^{(i)} $,通过两点两点边值问题(TPBVP)求解器计算 $ V^{(i)} $ 及其梯度 $ \bm{\lambda}^{(i)} $。
  • 使用结合值误差与梯度误差的损失函数训练深度神经网络以近似 $ V(t, \mathbf{x}) $:$ \mathcal{L} = \frac{1}{N_d}\sum (V^{(i)} - V^{NN})^2 + \frac{\mu}{N_d}\sum \|\bm{\lambda}^{(i)} - V_{\mathbf{x}}^{NN}\|^2 $。
  • 将训练好的网络用作后续TPBVP求解的热启动,实现在高误差或复杂区域的快速且自适应的数据生成。
  • 应用自适应循环:每轮训练后,根据预定义标准在近似误差较高的区域扩展数据集,指导数据分布。
  • 使用独立生成的蒙特卡罗验证集对最终神经网络进行验证,确保其经验准确性与可靠性。

实验结果

研究问题

  • RQ1无因果关系的算法如何用于高维最优控制问题中深度学习的训练数据生成?
  • RQ2与传统网格方法相比,无因果关系数据生成在可扩展性与并行化方面具有哪些优势?
  • RQ3基于神经网络误差估计的自适应数据生成是否能提升学习到的反馈控制器的精度?
  • RQ4在损失函数中同时使用值与梯度监督如何增强神经网络对价值函数及其导数的近似能力?
  • RQ5在6维刚体姿态控制问题中,使用无因果关系数据生成的深度学习反馈控制的实证性能如何?

主要发现

  • 无因果关系方法实现了无网格、并行化的价值函数解计算,使高维问题变得可处理。
  • 基于误差驱动采样的自适应数据生成在四轮训练中持续提升了神经网络精度,数据规模从64点扩展至4,096点。
  • 在损失函数中同时使用值与梯度监督,显著增强了网络对真实价值函数及其导数的近似能力。
  • 训练后的神经网络实现了稳定且精确的反馈控制律,经独立蒙特卡罗测试集验证,表现出经验可靠性。
  • 通过使用神经网络热启动,减少了对时间推进求解器的依赖,加速了后续训练轮次中的数据生成。
  • 该方法通过实现高精度、快速且经经验验证的神经网络近似,支持实际的实时反馈控制,用于最优控制律的近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。