Skip to main content
QUICK REVIEW

[论文解读] Deluca -- A Differentiable Control Library: Environments, Methods, and Benchmarking

Paula Gradu, John Hallman|arXiv (Cornell University)|Feb 19, 2021
Model Reduction and Neural Networks参考文献 29被引用 5
一句话总结

Deluca 是一个开源的可微分控制库,利用 JAX 实现基于物理的仿真动力学的自动微分,加速了基于梯度的控制方法。它为经典控制任务和新型医疗呼吸机仿真器提供了可微分环境,通过 JIT 编译实现仿真速度提升超过 1000 倍,并支持具有可证明保证的新方法在自适应控制和对抗性控制中的应用。

ABSTRACT

We present an open-source library of natively differentiable physics and robotics environments, accompanied by gradient-based control methods and a benchmark-ing suite. The introduced environments allow auto-differentiation through the simulation dynamics, and thereby permit fast training of controllers. The library features several popular environments, including classical control settings from OpenAI Gym. We also provide a novel differentiable environment, based on deep neural networks, that simulates medical ventilation. We give several use-cases of new scientific results obtained using the library. This includes a medical ventilator simulator and controller, an adaptive control method for time-varying linear dynamical systems, and new gradient-based methods for control of linear dynamical systems with adversarial perturbations.

研究动机与目标

  • 为强化学习和控制领域解决缺乏开源、原生可微分仿真环境的问题。
  • 通过在仿真动力学中实现自动微分,实现控制器的快速、基于梯度的训练。
  • 支持需要系统动力学导数的新型控制方法,例如自适应控制和扰动下的鲁棒控制。
  • 提供一个基准测试套件,用于基于梯度的控制算法,包括 LQR、GPC 和 H-infinity 控制。
  • 通过可微分仿真器支持数据高效、端到端的可学习控制器训练,如在医疗呼吸机控制中的应用。

提出的方法

  • 利用 JAX 的自动微分和 JIT 编译技术,实现对连续时间动力系统仿真过程的可微分处理。
  • 实现了一套可微分环境,包括 OpenAI Gym 环境的变体以及基于深度学习的医疗呼吸机仿真器。
  • 支持线性和非线性系统的可微分动力学,实现对状态转移和代价函数的梯度计算。
  • 使用函数式编程原语(例如 jax.lax.scan)优化仿真循环,在 JIT 编译后实现每步推理时间低于 1 纳秒。
  • 集成最先进的基于梯度的控制方法,如 AdaGPC、GPC 和 LQR,结合误差反馈,原生支持通过动力学的可微分处理。
  • 提供模块化 API,允许用户定义自定义可微分环境,包括基于神经网络的环境。

实验结果

研究问题

  • RQ1可微分仿真是否能够实现连续控制任务中控制策略的更快、更样本高效的训练?
  • RQ2可微分仿真在时变线性系统的自适应控制方法中,如何提升性能和收敛性?
  • RQ3在基于学习的控制中,如医疗呼吸机控制,可微分仿真在多大程度上能够减少数据和计算需求?
  • RQ4在对抗性扰动下,具有可证明保证的基于梯度的控制方法(如带误差反馈的 GPC)与经典方法(如 LQR 和 H-infinity 控制)相比表现如何?
  • RQ5在无模型策略梯度方法与基于可微分动力学的优化之间,计算和统计权衡是什么?

主要发现

  • 与标准的 NumPy 实现相比,Deluca 在仿真时间上实现了超过 1000 倍的加速,JIT 编译后每轮迭代时间降低至 38 纳秒。
  • 可微分呼吸机仿真器支持数据高效的控制器训练,显著减少了对大量真实世界数据或超参数调优的需求。
  • 在倒立摆任务中,基于梯度的控制方法(如 AdaGPC 和 GPC)相比 iLQR 和 LQR,在时变和对抗性扰动下表现出更优的鲁棒性。
  • 该库支持直接计算策略梯度,无需蒙特卡洛估计,从而降低方差,并在确定性系统中消除了对随机策略的需求。
  • 可微分动力学支持高效、确定性的控制策略优化,在样本效率和计算复杂度方面显著优于零阶或似然比梯度估计器。
  • 基准测试结果表明,带误差反馈的 GPC 在高斯、正弦和恒定扰动下均优于 LQR 和 H-infinity 控制,证明了可微分鲁棒控制的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。