[论文解读] Hamilton-Jacobi Deep Q-Learning for Deterministic Continuous-Time Systems with Lipschitz Continuous Controls
本文提出汉密尔顿-雅可比深度Q学习(HJ DQN),一种用于具有利普希茨连续控制的确定性连续时间最优控制的无模型强化学习方法。它基于动态规划推导出Q函数的半离散汉密尔顿-雅可比-贝尔曼(HJB)方程,实现无需对系统动力学进行离散化的数据驱动学习,并在利普希茨控制条件下实现向最优Q函数的收敛。
In this paper, we propose Q-learning algorithms for continuous-time deterministic optimal control problems with Lipschitz continuous controls. Our method is based on a new class of Hamilton-Jacobi-Bellman (HJB) equations derived from applying the dynamic programming principle to continuous-time Q-functions. A novel semi-discrete version of the HJB equation is proposed to design a Q-learning algorithm that uses data collected in discrete time without discretizing or approximating the system dynamics. We identify the condition under which the Q-function estimated by this algorithm converges to the optimal Q-function. For practical implementation, we propose the Hamilton-Jacobi DQN, which extends the idea of deep Q-networks (DQN) to our continuous control setting. This approach does not require actor networks or numerical solutions to optimization problems for greedy actions since the HJB equation provides a simple characterization of optimal controls via ordinary differential equations. We empirically demonstrate the performance of our method through benchmark tasks and high-dimensional linear-quadratic problems.
研究动机与目标
- 解决缺乏适用于具有利普希茨连续控制的确定性连续时间最优控制的无模型强化学习方法的问题。
- 克服离散时间强化学习方法需要精细时间离散化、且存在不稳定性和低效性的问题。
- 基于汉密尔顿-雅可比-贝尔曼方程,为连续时间系统构建一个理论基础坚实的Q学习框架,应用于状态-动作价值函数。
- 通过利用HJB方程对最优控制的表征,实现无需策略网络或迭代优化即可直接选择贪婪动作,从而实现实际应用。
- 在高维线性二次问题和MuJoCo基准测试中展示性能,实现稳定且数据高效的训练。
提出的方法
- 基于动态规划原理,推导出用于连续时间Q函数的新型半离散HJB方程,避免对系统动力学进行显式离散化。
- 基于Robbins-Monro随机逼近方法,制定一种无模型更新规则,利用离散时间转移样本更新Q函数。
- 提出汉密尔顿-雅可比DQN(HJ DQN)算法,通过直接使用HJB方程定义通过常微分方程(ODE)实现的贪婪动作,将深度Q网络扩展至连续时间控制。
- 通过HJB方程对最优控制的表征确保最优控制的选择:$ \dot{a} = L \frac{\nabla_{\bm{a}} Q}{|\nabla_{\bm{a}} Q|} $,从而无需额外优化或策略网络。
- 在控制上施加利普希茨约束($ |\bm{b}| \leq L $),以确保半离散HJB公式中的正则性和稳定性。
- 使用深度神经网络进行函数逼近,结合经验回放、目标网络以及来自DQN和DDPG基准的标准超参数实现算法。
实验结果
研究问题
- RQ1能否为具有利普希茨连续控制的确定性连续时间最优控制问题开发一种无模型Q学习算法?
- RQ2Q函数的半离散HJB方程是否能在不离散化系统动力学的情况下实现稳定且收敛的学习?
- RQ3HJB方程是否能直接表征最优控制,而无需额外优化或策略网络?
- RQ4与现有深度强化学习基线方法(如DDPG)相比,所提出的HJ DQN方法在高维连续控制任务中的表现如何?
- RQ5哪些超参数(如采样间隔、利普希茨常数)对连续时间强化学习中的稳定和高效学习至关重要?
主要发现
- 在控制输入为利普希茨连续的条件下,HJ DQN算法可收敛至最优Q函数。
- 该方法在MuJoCo基准任务(HalfCheetah-v2、Hopper-v2、Walker2d-v2、Swimmer-v2)上实现了稳定学习,且各环境的超参数均已调优。
- 在高维线性二次(LQ)问题中,HJ DQN成功学习到接近最优的策略,且折扣因子设为 $ \gamma = -\log(0.99999)/h $,与连续时间动力学一致。
- HJ DQN在样本效率和训练稳定性方面优于DDPG,尤其在高维和连续控制场景中表现更优。
- 该算法通过直接利用HJB方程定义贪婪动作,消除了对策略网络和迭代控制优化的需求。
- 实验结果表明,采样间隔 $ h $ 和利普希茨常数 $ L $ 的选择显著影响学习性能,且调优后的 $ h $ 可提升收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。